El 17 y 19 de junio se lanzaron las versiones 1.9.0 y 1.9.1 del sistema de reconocimiento de voz de alto rendimiento. whisper.cpp, implementando el modelo Whisper de OpenAI, basado en una biblioteca de tensor de aprendizaje automático. GGML y en formato binario. GGUF.
Se proporciona la biblioteca libwhisper, ejemplos de demostración y utilidades de consola: whisper-bench, whisper-cli, whisper-command, whisper-lsp, whisper-quantize, whisper-server, whisper-stream, whisper-vad-speech-segments, parakeet-cli y parakeet-quantize.
Los proyectos están escritos en C y C++ y se distribuyen bajo la licencia MIT.
Cambios:
- se ha añadido la utilidad de consola parakeet-cli, que soporta el modelo NVIDIA Parakeet;
- se ha añadido soporte para NVIDIA Parakeet también en el wrapper de Ruby.
Algunos cambios importantes realizados en versiones intermedias desde la noticia de whisper.cpp 1.8.0:
- manejo de excepciones en C++ en la función whisper_init_with_params_no_state;
- se ha reescrito completamente el soporte para ffmpeg (sin usar código GPL tomado de ejemplos de ffmpeg), y se ha aclarado el uso de ffmpeg en whisper.cpp;
- se ha añadido la opción —version en la utilidad whisper-cli para mostrar la versión.
Fuente: linux.org.ru




