A fost publicată versiunea 5.1 a sistemului de recunoaștere optică a textului Tesseract, care suportă recunoașterea caracterelor UTF-8 și a textelor în peste 100 de limbi, inclusiv rusă, kazahă, belarusă și ucraineană. Rezultatul poate fi salvat atât ca text simplu, cât și în formate HTML (hOCR), ALTO (XML), PDF și TSV. Inițial, sistemul a fost creat între 1985 și 1995 în laboratorul companiei Hewlett Packard, iar în 2005 codul a fost deschis sub licența Apache și a fost ulterior dezvoltat cu participarea angajaților companiei Google. Codurile sursă ale proiectului sunt distribuite sub licența Apache 2.0.
Tesseract include o utilitate de consolă și biblioteca libtesseract pentru integrarea funcțiilor de recunoaștere a textului în alte aplicații. Printre interfețele GUI terță parte care suportă Tesseract se numără gImageReader, VietOCR și YAGF. Oferă două motoare de recunoaștere: clasic, care recunoaște textul la nivel de șablon pentru caractere individuale, și noul, bazat pe aplicarea unui sistem de învățare automată bazat pe rețele neuronale recurente LSTM, optimizat pentru recunoașterea întregilor linii și care permite o îmbunătățire semnificativă a preciziei. Modelele antrenate sunt publicate pentru 123 de limbi. Pentru optimizarea performanței, sunt disponibile module care folosesc OpenMP și instrucțiuni SIMD AVX2, AVX, NEON sau SSE4.1.
Îmbunătățiri majore în Tesseract 5.1:
- S-a realizat posibilitatea de a procesa zone cu imagini și linii la ieșirea în formate ALTO, hOCR și text.
- A fost adăugat un nou parametru curl_timeout lkz curl_easy_setop.
- Sistemul de construcție a fost îmbunătățit.
- A fost efectuată o muncă de eliminare a codului neutilizat.
- Au fost corectate problemele cauzate de procesarea incorectă a pointerilor nuli în clasa PageIterator::Orientation.
Sursa: opennet.ro
