A fost lansată versiunea 5.3.4 a sistemului de recunoaștere optică a caracterelor Tesseract, care suportă recunoașterea caracterelor UTF-8 și a textelor în peste 100 de limbi, inclusiv rusă, kazahă, belarusă și ucraineană. Rezultatul poate fi salvat atât ca text deschis, cât și în formate HTML (hOCR), ALTO (XML), PDF și TSV. Sistemul a fost inițial creat între 1985-1995 în laboratorul companiei Hewlett Packard, codul fiind deschis în 2005 sub licența Apache și dezvoltarea continuând cu participarea angajaților companiei Google. Textele sursă ale proiectului sunt distribuite sub licența Apache 2.0.
Tesseract include o utilitară de linie de comandă și biblioteca libtesseract pentru a încorpora funcțiile de recunoaștere a textului în alte aplicații. Dintre interfețele GUI terță parte care suportă Tesseract, se pot menționa gImageReader, VietOCR și YAGF. Sunt oferite două motoare de recunoaștere: clasic, care recunoaște textul la nivelul șablonului de caractere individuale, și noul motor bazat pe utilizarea sistemului de învățare automată cu rețea neurală recurentă LSTM, optimizat pentru recunoașterea întregilor linii și care permite obținerea unei creșteri semnificative a acurateței. Modelele antrenate sunt publicate pentru 123 de limbi. Pentru optimizarea performanței, sunt propuse module care utilizează OpenMP și instrucțiuni SIMD AVX2, AVX, AVX512F, NEON sau SSE4.1.
Îmbunătățiri principale:
- Recunoașterea imaginilor prin URL a fost îmbunătățită cu încărcarea fișierului folosind biblioteca libcurl. La încărcare, se asigură setarea antetului User-Agent. A fost adăugat un nou parametru curl_cookiefile pentru utilizarea unui fișier cu Cookie.
- În server ScrollView folosește TCP ca protocol prioritar.
- Când se folosește comanda „combine_tessdata -d”, rezultatul este acum redirecționat către stdout în loc de stderr.
- Au fost rezolvate problemele de compilare când se folosește autoconf și clang.
Sursa: opennet.ro
