ĂshtĂ« publikuar lĂ«shimi i sistemit tĂ« njohjes optike tĂ« tekstit Tesseract 5.1, i cili mbĂ«shtet njohjen e simboleve UTF-8 dhe teksteve nĂ« mĂ« shumĂ« se 100 gjuhĂ«, pĂ«rfshirĂ« rusisht, kazakisht, bjellorusisht dhe ukrainisht. Rezultati mund tĂ« ruhet si tekst i hapur, ashtu edhe nĂ« formate HTML (hOCR), ALTO (XML), PDF dhe TSV. Fillimisht, sistemi u krijua nĂ« vitet 1985-1995 nĂ« laboratorin e kompanisĂ« Hewlett Packard, dhe nĂ« vitin 2005 kodi u hap nĂ«n licencĂ«n Apache dhe mĂ« pas u zhvillua me ndihmĂ«n e punonjĂ«sve tĂ« kompanisĂ« Google. Tekstet burimore tĂ« projektit shpĂ«rndahen nĂ«n licencĂ«n Apache 2.0.
Tesseract përfshin një mjet konzole dhe bibliotekën libtesseract për integrimin e funksioneve të njohjes së tekstit në aplikacione të tjera. Ndër ndërfaqet GUI të palëve të treta që mbështesin Tesseract mund të veçohen gImageReader, VietOCR dhe YAGF. Ofrohen dy motorë njohjeje: ai klasik, që njeh tekstin në nivelin e modeleve të karaktereve individuale, dhe një i ri, i bazuar në përdorimin e një sistemi të mësimit makinerik me rrjet nervor rekurent LSTM, i optimizuar për njohjen e rreshtave të plotë dhe që mundëson rritje të ndjeshme të saktësisë. Janë publikuar modele të gatshme të trajnuara për 123 gjuhë. Për optimizimin e performancës ofrohen module që përdorin OpenMP dhe instruksionet SIMD AVX2, AVX, NEON ose SSE4.1.
Përmirësimet kryesore në Tesseract 5.1:
- ĂshtĂ« realizuar mundĂ«sia pĂ«r tĂ« pĂ«rpunuar zona me imazhe dhe linja nĂ« daljet nĂ« formatet ALTO, hOCR dhe tekst.
- Shtohet parametri i ri curl_timeout lkz curl_easy_setop.
- ĂshtĂ« pĂ«rmirĂ«suar sistemi i ndĂ«rtimit.
- ĂshtĂ« bĂ«rĂ« punĂ« pĂ«r tĂ« hequr kodin e papĂ«rdorur.
- Janë eliminuar crash-et e shkaktuara nga trajtimi i papërshtatshëm i treguesve të null në klasën PageIterator::Orientation.
Burimi: opennet.ru
