Avaldasime Tesseract 4.1 optilise tekstituvastuse süsteemi, mis toetab UTF-8 kodeeringu ja enam kui 100 keele, sealhulgas vene, kasahhi, valgevene ja ukraina, tuvastamist. Tulemused võivad säilida nii avatud tekstina kui ka HTML (hOCR), ALTO (XML), PDF ja TSV formaatides. Süsteem loodi algselt 1985–1995 Hewlett Packardi laboris, kood avati 2005. aastal Apache litsentsi alusel ja edaspidi arendati seda Google'i töötajate kaasabil. Projekti allikakood jaotatakse Apache 2.0 litsentsi alusel.
Tesseract hõlmab käsurea utiliiti ja libtesseract teeki, et integreerida tekstituvastuse funktsioone teistesse rakendustesse. Tesseracti toetavatest kolmandate osapoolte GUI-dest võib mainida gImageReader, VietOCR ja YAGF. Pakutakse kahte tunnustust: klassikaline, mis tuvastab sümbolite üksikute mustrite tasemel, ja uus, mis põhineb süvaõppe süsteemil, mille aluseks on LSTM rekurentne närvivõrk, mis on optimeeritud terve rida tunnustamiseks ja võimaldab saavutada märkimisväärset täpsuse suurendamist. Koolitatud mudelid on avaldatud 123 keele jaoks. Tõhususe optimeerimiseks on pakkuda mooduleid, mis kasutavad OpenMP ja SIMD-jochtude AVX2, AVX, NEON või SSE4.1.
Peamised täiustused Tesseract 5.0:
- Oluline versioonimuutus on seotud API-s tehtud muudatustega, mis rikuvad ühilduvust. Eelkõige ei ole avalikult kergesti kätte saadav libtesseract API enam seotud omanike andmetüüpidega GenericVector ja STRING, nende asemel kasutatakse koodis std::string ja std::vector.
- Algteksti puu on reorganiseeritud. Avalikud päisefailid on viidud katalooge include/tesseract.
- Mäluhaldus on ümber töötatud, kõik malloc ja free kutsed on asendatud C++ koodiga. Koodi üldine moderniseerimine on läbi viidud.
- Lisatud optimeerimised ARM ja ARM64 arhitektuuride jaoks, et kiirendada arvutusi ARM NEON käskude kasutamise kaudu. Teostatud üldine jõudluse optimeerimine, mis kehtib kõigi arhitektuuride kohta.
- Teostatud uute mudelite treenimise ja tekstituvastuse režiimide rakendamine, mis põhinevad liikuva komaga arvutuste kasutamisel. Uued režiimid pakuvad kõrgemat jõudlust ja madalamat mälutarbimist. LSTM-mootoris on kiire float32 režiim vaikimisi sisse lülitatud.
- Lähenetud Unicode normaliseerimise kasutamisele NFC (Normalization Form Canonical) vormi abil.
- Lisatud valik logide detailide seadistamiseks (—loglevel).
- Ümber kujundatud Autotools põhinev kogumissüsteem, mis on muutunud mitte-rekursiivseks kogumiseks.
- Git-i haru «master» on ümber nimetatud «main»-iks.
- Lisatud tugi uutele macOS väljaannetele ja Apple'i süsteemidele, mis põhinevad M1 kiibil.
Allikas: opennet.ru
