optiliseeritud tekstituvastussüsteemi väljalase , mis toetab UTF-8 sümbolite tunnustamist ja tekste üle 100 keeles, sealhulgas vene, kasahhi, valgevene ja ukraina keeles. Tulemused saavad salvestuda avatud tekstina või formaatidena HTML (hOCR), ALTO (XML), PDF ja TSV. Alguses loodi süsteem aastatel 1985–1995 Hewlett Packardi laboris, 2005. aastal avati kood Apache litsentsi all ja seda arendati edasi Google'i töötajate osalusel. Projekti algsed tekstid ainekood on litsentsitud Apache 2.0 all.
Tesseract sisaldab konsooliprogrammi ja libtesseract teeki, et integreerida tekstituvastusfunktsioone teistele rakendustele. Tesseracti toetavate kolmandate osapoolte võib välja tuua , ja . Pakutakse kahte tuvastamisvõimet: klassikaline, mis tuvastab teksti sümbolite mustrite tasandil, ning uus, mis põhineb masinõppe süsteemi rakendamisel rekursiivsete närvivõrkude LSTM baasil ning on optimeeritud terveid ridu tuvastama, võimaldades saavutada märkimisväärset täpsuse kasvu. Valmis treenitud mudelid on avaldatud . Sooritusvõime optimeerimiseks pakutakse mooduleid, mis kasutavad OpenMP ja SIMD AVX2, AVX või SSE4.1 käske.
Peamised Tesseract 4.1-s:
- Lisatud XML-väljundi võimalus (Analyzed Layout and Text Object). Selle formaadi kasutamiseks tuleks rakendus käivitada kui «tessaract pildi_nimi väljundi_kataloog alto»;
- Lisatud uued renderdamismoodulid LSTMBox ja WordStrBox, mis lihtsustavad mootori treenimise protsessi;
- Lisatud toetus pseudo-graafika väljundis hOCR (HTML);
- Lisatud alternatiivsed skriptid Pythonis masinõppe mootori treenimiseks;
- Optimeerimisi on laienenud, kasutades AVX, AVX2 ja SSE käske;
- Vaikimisi on OpenMP tugi välja lülitatud sooritusvõime tõttu;
- LSTM mootori puhul on lisatud valgete ja mustade nimekirjade tugi;
- Cmake'iga põhinevad ehitusskeemid on täiustatud.
Allikas: opennet.ru
