El 6 de enero se lanzó la versión 1.7.4 de un sistema de reconocimiento de voz de alto rendimiento. whisper.cpp, implementando el modelo Whisper desarrollado por OpenAI, escrito en los lenguajes C y C++ y distribuido bajo la licencia MIT.
El proyecto utiliza una biblioteca de tensores de aprendizaje automático GGML, escrito en C y optimizado para el uso de diversos backends (CUDA, Vulkan, BLAS, SYCL, OpenCL, etc.).
Lista de cambios:
- Renombramientos de archivos ejecutables:
main -> whisper-cli bench -> whisper-bench stream -> whisper-stream command -> whisper-command server -> whisper-server talk-llama -> whisper-talk-llama
- Se eliminaron los ejemplos talk y talk.wasm.
- Se añadió una opción para suprimir los tokens no verbales en whisper-server.
- El parámetro suppress_non_speech_tokens se renombró a suppress_nst.
- Se añadió en la API y utilidades la opción no_speech_thold para establecer la probabilidad de ausencia de habla en el nivel de segmento durante la transcripción.
- Se añadió en whisper-cli la opción —suppress_nst.
- Otras mejoras y correcciones de errores.
Fuente: linux.org.ru
