Tesseract 5.1 optiliseeri tuvastamise sĂŒsteemi vĂ€ljaanne on avaldatud, toetades UTF-8 sĂŒmbolite tuvastamist ja tekste rohkem kui 100 keeles, sealhulgas vene, kasahhi, valgevene ja ukraina. Tulemused vĂ”ivad olla salvestatud nii avatud tekstina kui ka HTML (hOCR), ALTO (XML), PDF ja TSV formaatides. Algne sĂŒsteem loodi aastatel 1985â1995 Hewlett Packardi laboris, 2005. aastal vabastati kood Apache litsentsi alusel ja edaspidi arendati seda koostöös Google'i töötajatega. Projekti lĂ€htekoodid levivad Apache 2.0 litsentsi all.
Tesseract hĂ”lmab kĂ€surea utiliiti ja libtesseract teeki, et integreerida tekstituvastuse funktsioone teistesse rakendustesse. Tesseracti toetavatest kolmandate osapoolte GUI-dest vĂ”ib mainida gImageReader, VietOCR ja YAGF. Pakutakse kahte tunnustust: klassikaline, mis tuvastab sĂŒmbolite ĂŒksikute mustrite tasemel, ja uus, mis pĂ”hineb sĂŒvaĂ”ppe sĂŒsteemil, mille aluseks on LSTM rekurentne nĂ€rvivĂ”rk, mis on optimeeritud terve rida tunnustamiseks ja vĂ”imaldab saavutada mĂ€rkimisvÀÀrset tĂ€psuse suurendamist. Koolitatud mudelid on avaldatud 123 keele jaoks. TĂ”hususe optimeerimiseks on pakkuda mooduleid, mis kasutavad OpenMP ja SIMD-jochtude AVX2, AVX, NEON vĂ”i SSE4.1.
Tesseract 5.1 peamised tÀiustused:
- Kuvataks now piltide ja joontega piirkondade töötlemise vÔimalus formaatides ALTO, hOCR ja tekst.
- Lisa uus parameeter curl_timeout lkz curl_easy_setop.
- Parandatud ehitussĂŒsteem.
- Tehti tööd kasutamata koodi eemaldamiseks.
- Eemaldatud tÔrked, mis on pÔhjustatud vale nullnÀidikute töötlemisest klassis PageIterator::Orientation.
Allikas: opennet.ru
