Avaldasime Tesseract 5.2 versiooni optilise tekstituvastuse sĂŒsteemist, mis toetab UTF-8 tĂ€hemĂ€rkide ja tekstide tuvastamist enam kui 100 keeles, sealhulgas vene, kasahhi, valgevene ja ukraina keeles. Tulemusi saab salvestada avatud tekstina vĂ”i formaatides HTML (hOCR), ALTO (XML), PDF ja TSV. SĂŒsteem loodi algselt aastatel 1985-1995 Hewlett Packardi laboratooriumis, 2005. aastal avati kood Apache litsentsi all ning seda arendati hiljem Google'i töötajate kaasabil. Projekti lĂ€htekood on levitatud Apache 2.0 litsentsi alusel.
Tesseract sisaldab kÀsurealiidese tööriista ja raamatukogu libtesseract, et sisestada tekstituvastusfunktsioone teistesse rakendustesse. Tesseracti toetavate kolmandate osapoolte GUI-de seas vÔib vÀlja tuua gImageReader, VietOCR ja YAGF. Pakutakse kahte tekstituvastusmootorit: klassikaline, mis tunneb Àra tÀhemÀrgid eraldi mallide tasandil, ja uus, mis pÔhineb masinÔppes, kasutades korduvaid nÀrvivÔrke LSTM, mis on optimeeritud kogu ridade Àratundmiseks ja vÔimaldab oluliselt parandada tÀpsust. Valmis treenitud mudeleid on avaldatud 123 keele jaoks. JÔudluse optimeerimiseks on pakutud mooduleid, mis kasutavad OpenMP ja SIMD-instruktsioone AVX2, AVX, AVX512F, NEON vÔi SSE4.1.
Tesseract 5.2 peamised tÀiustused:
- Lisatud on optimeerimised, mis on rakendatud Intel AVX512F kÀskluste kaudu.
- C API-s on rakendatud funktsioon tesseracti initsialiseerimiseks, laadides masinÔppe mudeli mÀlust.
- Lisatud on parameeter invert_threshold, mis mÀÀrab tekstiridade inverteerimise taseme. Vaikimisi on vÀÀrtus 0.7. Inverteerimise keelamiseks tuleks mÀÀrata vÀÀrtus 0.
- VÀÀrokumentide töötlemine 32-bitistes hostides on paranenud.
- On lĂ€ikunud ĂŒleminek std::regex funktsioonidelt std::string kasutamisele.
- Parandatud kogumise stsenaariume Autotools'i, CMake'i ja pideva integreerimise sĂŒsteemide jaoks.
Allikas: opennet.ru
