Kështu është publikuar lëshohet versioni i sistemit të njohjes optike të tekstit Tesseract 5.3.4, i cili mbështet njohjen e simboleve UTF-8 dhe teksteve në më shumë se 100 gjuhë, duke përfshirë rusisht, kazakisht, bjellorusisht dhe ukrainisht. Rezultati mund të ruhet si tekst i hapur, ashtu si edhe në formate HTML (hOCR), ALTO (XML), PDF dhe TSV. Fillimisht, sistemi u krijua në vitet 1985-1995 në laboratorin e kompanisë Hewlett Packard, në vitin 2005 kodi u hap nën licencën Apache dhe më pas u zhvillua me pjesëmarrjen e punonjësve të kompanisë Google. Tekstet origjinale të projektit shpërndahen nën licencën Apache 2.0.
Tesseract përfshin një mjet konsolë dhe bibliotekën libtesseract për të inkorporuar funksionet e njohjes së tekstit në aplikacione të tjera. Midis GUI-ve të treta që mbështesin Tesseract, përmendim gImageReader, VietOCR dhe YAGF. Oferohen dy motorë njohjeje: një klasik, që njeh tekstin në nivelin e shablloneve të simboleve individuale, dhe një e re, e bazuar në përdorimin e një sistemi të mësimit të makines me rrjetin nervor rekurent LSTM, e optimizuar për njohjen e linjave të plota dhe që lejon një rritje të rëndësishme të saktësisë. Modelet e trajnuara janë publikuar për 123 gjuhë. Për optimizimin e performancës, ofrohen module që përdorin OpenMP dhe instrukcione SIMD AVX2, AVX, AVX512F, NEON ose SSE4.1.
Përmirësimet kryesore:
- ĂshtĂ« pĂ«rmirĂ«suar njohja e imazheve pĂ«rmes URL-sĂ« nga ngarkimi i skedarĂ«ve me ndihmĂ«n e bibliotekĂ«s libcurl. GjatĂ« ngarkimit Ă«shtĂ« siguruar dĂ«rgimi i titullit User-Agent. ĂshtĂ« shtuar njĂ« parametr i ri curl_cookiefile pĂ«r pĂ«rdorimin e njĂ« skedari me cookie.
- Në serveri ScrollView është aktivizuar si protokoll prioritar TCP.
- Gjatë përdorimit të komandës "combine_tessdata -d" është siguruar që rezultati të dërgohet në rrjedhën stdout në vend të stderr.
- Janë eliminuar problemet me ndërtimin kur përdoret autoconf dhe clang.
Burimi: opennet.ru
