Компанията Mozilla развива инструмента за разпознаване на реч Whisperfile, който включва независима, високопроизводителна реализация на модела за машинно обучение Whisper, разработен и публикуван от организацията OpenAI. Инструментът е създаден на основата на whisper.cpp, реализация на модела Whisper на C/C++, разработена от Георги Георгиев (автор на llama.cpp). Кодът е написан на езика C++ и се разпространява под лиценза MIT.
Whisperfile се развива от екипа на Mozilla Ocho и допълва проекта llamafile, предназначен за създаване на универсални изпълними файлове за стартиране на големи езикови модели на машинно обучение (LLM). Подобно на llamafile, проектът whisperfile позволява на базата на файл с параметрите на модела за машинно обучение в формат GGUF да се генерира изпълним файл, който може да се стартира в различни операционни системи на устройства с процесори AMD64 и ARM64. Компилираният код може да се свързва със стандартната Си-библиотека Cosmopolitan, която позволява създаване на приложения, работещи в Linux, FreeBSD, macOS, OpenBSD, NetBSD и Windows.
При стартиране на изпълним файл, като входен параметър се предава файл със звукова реч в формат wav, mp3, ogg или flac, а на изхода се запазва разпознатият текст. На практика проектът може да се използва за решаване на задачи, като генериране на текстови надписи за видео, създаване на лог на гласови и видео разговори, преобразуване на записани гласови материали в текст, организация на гласов вход. С помощта на Whisperfile подобни задачи могат да се изпълняват на локалната система без подаване на заявки към външни услуги.
Допълнително се поддържа работа в ролята на HTTP-сървър, който обработва заявки за разпознаване на реч чрез Web API. За ускоряване на работата с модела могат да се използват GPU и инструкции AVX. Инструментът може също така да предоставя коефициенти на достоверност, позволяващи да се оцветяват разпознатите думи в зависимост от точността на тяхното определяне.

Използваната модел Whisper е обучена на 680 хиляди часа речеви данни, които обхващат различни тематични области и езици (2/3 от данните са на английски). Моделът успешно разпознава реч с акцент, определя технически жаргон, поддържа автоматично определяне на езика и може да работи при наличие на фонов шум. За речта на английски език системата демонстрира ниво на надеждност и точност на автоматичното разпознаване, близко до това на човек. Освен за транскрипция на реч в текст, моделът може да се прилага и за превод на реч на друг език.
Източник: opennet.ru
