Tesseract 5.4.0 tekstituvastussüsteemi väljaanne

Avaldatud on tekstituvastussüsteemi Tesseract 5.4.0 versioon, mis toetab UTF-8 märke ja tekste rohkem kui 100 keeles, sealhulgas vene, kasahhi, valgevene ja ukraina keeles. Tulemusi saab salvestada avatud tekstina ning HTML (hOCR), ALTO (XML), PDF ja TSV formaatides. Alguses loodi süsteem aastatel 1985-1995 Hewlett Packardi laboratooriumis, 2005. aastal avati kood Apache litsentsi alusel ja seda arendati edasi Google’i töötajate osalusel. Projekti algsed tekstid levitatakse Apache 2.0 litsentsi alusel.

Tesseract sisaldab käsurea utiliiti ja libtesseract teeki, et integreerida teksti tuvastamise funktsioone teistesse rakendustesse. Tesseracti toetavate kolmanda osapoole GUI-de hulka kuuluvad gImageReader, VietOCR ja YAGF. Pakutakse kahte tuvastusmootorit: klassikaline, mis tuvastab teksti üksikute sümbolite mallide tasandil, ja uus, mis põhineb masinõppes rakendatud korduvatel närvivõrkudel LSTM, optimeeritud ridade tervikuna tuvastamiseks, mis võimaldab saavutada märgatavat täpsuse tõusu. Koolitatud mudelid on avaldatud 123 keele jaoks. Tõhususe optimeerimiseks pakutakse mooduleid, mis kasutavad OpenMP ja SIMD-käsklusi, sealhulgas AVX2, AVX, AVX512F, NEON või SSE4.1.

Peamised täiustused:

  • Lisatud on toetus PAGE-XML formaadis joonistamiseks ja exportimiseks.
  • Realiseeritud on mudeli treenimise võimalus, kasutades PNG formaadis faile LSTMF failide asemel.
  • PDF formaadis joonistamine on paranenud.
  • API-d on laiendatud teksti kallakute määramise jaoks.
  • Eemaldatud on jõudlusprobleemid, mis tuvastati Coverity süsteemis skaneerimise ajal.

Allikas: opennet.ru

Osta usaldusväärne veebimajutus DDoS-kaitsega veebisaitidele, VPS VDS serverid 🔥 Osta usaldusväärne veebimajutus DDoS-kaitsega veebisaitidele, VPS VDS serverid - ProHoster