U hap kodi i sistemit të njohjes dhe përkthimit të zërit Whisper

Projekti OpenAI, i angazhuar në zhvillimin e projekteve të hapura në fushën e inteligjencës artificiale, publikoi rezultatet e lidhura me sistemin e njohjes së zërit Whisper. Thuhet se për të folur në gjuhën angleze, sistemi ofron nivele besueshmërie dhe saktësie në njohjen automatike që janë të ngjashme me njohjen njerëzore. Kodi i zbatimit të referencës është i hapur, i ndërtuar mbi kornizën PyTorch dhe një grup modelet të trajnuara tashmë, të gatshme për përdorim. Kodi është i hapur nën licencën MIT.

Për të trajnuar modelin, janë përdorur 680 mijë orë të dhënash të zërit, të mbledhura nga disa koleksione që mbulojnë gjuhë dhe fusha tematike të ndryshme. Afërsisht 1/3 e të dhënave të zërit të përdorura në trajnim i përkasin gjuhëve që nuk janë angleze. Sistemi i propozuar përpunon saktësisht situata të tilla si shqiptimi me theks, prania e zhurmave në sfond dhe përdorimi i zhargoneve teknike. Përveç transkriptimit të zërit në tekst, sistemi gjithashtu mund të përkthejë zërin nga çdo gjuhë në anglisht dhe të identifikojë shfaqjen e zërit në rrjedhën e zërit.

Modelet janë formuluar në dy përfaqësime: një model për gjuhën angleze dhe një model shumëgjuhësor, që mbështet gjithashtu gjuhët ruse, ukrainase dhe belorusisht. Nga ana tjetër, çdo përfaqësim ndahet në 5 variante, që dallojnë në madhësi dhe numrin e parametrave të mbuluar në model. Sa më e madhe të jetë madhësia, aq më e lartë është saktësia dhe cilësia e njohjes, por edhe kërkesat për dimensionin e memories video të GPU janë më të larta dhe performanca më e ulët. Për shembull, varianti minimal përfshin 39 milion parametra dhe kërkon 1 GB memories video, ndërsa varianti maksimal përfshin 1550 milion parametra dhe kërkon 10 GB memories video. Varianti minimal është 32 herë më i shpejtë se maksimal.

U hap kodi i sistemit të njohjes dhe përkthimit të zërit Whisper

Në sistem përdoret arkitektura e rrjeteve nervore 'Transformer', që përfshin një kodues dhe një dekodues që ndërveprojnë me njëri-tjetrin. Zëri ndahet në fragmente 30-sekondëshe, të cilat përshtaten në log-Mel spektrogram dhe i dërgohet koduesit. Rezultati i punës së koduesit i drejtohet dekoduesit, i cili parashikon përfaqësimin tekstual, të përzier me tokene speciale, që lejojnë një model të përbashkët për të zgjidhur detyra të tilla si përcaktimi i gjuhës, mbajtja parasysh e rendit kronologjik të shqiptimit të frazave, transkriptimi i zërit në gjuhë të ndryshme dhe përkthimi në anglisht.

Burimi: opennet.ru

Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster