Mozilla desarrolla herramientas para el reconocimiento de voz Whisperfile

Mozilla está desarrollando herramientas de reconocimiento de voz Whisperfile, que incluyen una implementación independiente y de alto rendimiento del modelo de aprendizaje automático Whisper, desarrollado y liberado por la organización OpenAI. La herramienta está basada en whisper.cpp, una implementación del modelo Whisper en C/C++, creada por Georgi Gerganov (autor de llama.cpp). El código está escrito en C++ y se distribuye bajo la licencia MIT.

Whisperfile es desarrollado por el equipo de Mozilla Ocho y complementa el proyecto llamafile, destinado a crear archivos ejecutables universales para ejecutar grandes modelos de lenguaje de aprendizaje automático (LLM). Al igual que llamafile, el proyecto whisperfile permite generar un archivo ejecutable a partir de un archivo con parámetros de un modelo de aprendizaje automático en formato GGUF, que puede ejecutarse en varios sistemas operativos en hardware con procesadores AMD64 y ARM64. El código compilado puede vincularse con la biblioteca estándar de C Cosmopolitan, permitiendo construir aplicaciones que se ejecuten en Linux, FreeBSD, macOS, OpenBSD, NetBSD y Windows.

Al ejecutar el archivo ejecutable, se pasa un archivo de audio de voz en formato wav, mp3, ogg o flac como parámetro de entrada, y el texto reconocido se guarda como salida. En la práctica, el proyecto se puede aplicar a tareas como la generación de subtítulos de texto para video, la creación de registros de llamadas de voz y video, la conversión de grabaciones de voz en texto y la organización de entrada de voz. Con Whisperfile, tales tareas pueden resolverse en el sistema local sin necesidad de acudir a servicios externos.

Además, se admite el funcionamiento como un servidor HTTP, que procesa las solicitudes de reconocimiento de voz a través de Web API. Para acelerar el trabajo con el modelo, se pueden utilizar GPU e instrucciones AVX. La herramienta también puede proporcionar coeficientes de confianza, que permiten resaltar las palabras reconocidas según la precisión de su identificación.

Mozilla desarrolla herramientas para el reconocimiento de voz Whisperfile

El modelo Whisper utilizado ha sido entrenado con 680 mil horas de datos de voz, abarcando diferentes temas e idiomas (2/3 de los datos están en inglés). El modelo maneja bien el reconocimiento del habla con acento, identifica la jerga técnica, soporta la detección automática del idioma y puede funcionar con ruido de fondo. Para el habla en inglés, el sistema demuestra un nivel de fiabilidad y precisión en el reconocimiento automático cercano al reconocimiento humano. Además de la transcripción de voz a texto, el modelo también puede aplicarse para la traducción de voz a otro idioma.

Fuente: opennet.ru

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster