Avaldatud on optilise tekstituvastuse sĂŒsteemi Tesseract 5.1 versioon, mis toetab UTF-8 tĂ€hemĂ€rkide tuvastamist ja enam kui 100 keele, sealhulgas vene, kasahhi, valgevene ja ukraina tekste. Tulemus vĂ”ib salvestuda avatud tekstina ning HTML (hOCR), ALTO (XML), PDF ja TSV formaatides. Algne sĂŒsteem loodi aastatel 1985-1995 Hewlett Packardi laboris, 2005. aastal avati kood Apache litsentsi all ja seda arendati hiljem koos Google'i töötajatega. Projekti lĂ€htekood jaotatakse Apache 2.0 litsentsi alusel.
Tesseract sisaldab kĂ€surealiidest ja libtesseract teeki, et integreerida tekstituvastuse funktsioone teistesse rakendustesse. Tesseracti toetavate kolmandate osapoolte GUI-liideste seas vĂ”ib nimetada gImageReaderit, VietOCR-i ja YAGF-i. Pakutakse kahte tuvastusmootorit: klassikaline, mis tuvastab tekste ĂŒksikute sĂŒmbolite tasemel, ja uus, mis pĂ”hineb masinĂ”ppemeetoditel, kasutades LSTM rekursiivset nĂ€rvivĂ”rku, mis on optimeeritud ridade tuvastamiseks ja mille abil saavutatakse mĂ€rkimisvÀÀrne tĂ€psuse suurenemine. Valmis treenitud mudelid on avaldatud 123 keele jaoks. Tootlikkuse optimeerimiseks pakutakse mooduleid, mis kasutavad OpenMP-d ja AVX2, AVX, NEON vĂ”i SSE4.1 SIMD kĂ€ske.
Tesseract 5.1 pÔhimuudatused:
- On rakendatud vÔimalus töödelda piirkondi, kus on pilte ja jooni, ALTO, hOCR ja text formaatides vÀljundit genereerides.
- Uus parameeter curl_timeout lkz curl_easy_setopt.
- KogumissĂŒsteemi on parandatud.
- On tehtud tööd mittevajaliku koodi eemaldamiseks.
- Vead, mis olid pÔhjustatud vale nullnÀitaja töötlemisest klassis PageIterator::Orientation, on kÔrvaldatud.
Allikas: opennet.ru
