A fost lansată versiunea sistemului de recunoaștere optică a textului Tesseract 5.5.0, care suportă Unicode și recunoașterea textelor în peste 100 de limbi, inclusiv rusă, kazahă, belarusă și ucraineană. Rezultatul poate fi salvat atât ca text deschis, cât și în formate HTML (hOCR), ALTO (XML), PDF și TSV. Sistemul a fost inițial creat între 1985 și 1995 în laboratorul companiei Hewlett Packard, iar în 2005 codul a fost deschis sub licența Apache și dezvoltat ulterior cu implicarea angajaților companiei Google. Codurile sursă ale proiectului sunt distribuite sub licența Apache 2.0.
Tesseract include o utilitară de consolă și biblioteca libtesseract pentru integrarea funcțiilor de recunoaștere a textului în alte aplicații. Printre interfețele GUI de terță parte care suportă Tesseract se numără gImageReader, VietOCR și YAGF. Sunt oferite două motoare de recunoaștere: cel clasic, care recunoaște textul la nivel de șablon pentru caractere individuale, și noul motor, bazat pe aplicarea unui sistem de învățare automată bazat pe rețele neuronale recurente LSTM, optimizat pentru recunoașterea întregilor linii și care permite o creștere semnificativă a acurateței. Modelele pre-antrenate sunt disponibile pentru 123 de limbi. Pentru optimizarea performanței, sunt oferite module care utilizează OpenMP și instrucțiuni SIMD AVX2, AVX, AVX512F, NEON sau SSE4.1.
Îmbunătățiri principale:
- A fost adăugată suportul pentru extensiile vectoriale RISC-V V, pe baza cărora au fost pregătite optimizări în assembler pentru sistemele cu procesoare RISC-V.
- Atunci când se salvează rezultatul în format hOCR, sunt setate parametrilor ocrp_dir și ocrp_lang în fișierul creat.
- Codul pentru determinarea modelelor lingvistice disponibile a fost modernizat.
- Codul pentru generarea fișierelor în format hOCR a fost îmbunătățit și a fost eliminată conversia numelui fișierelor pe platforma Windows.
- A fost permisă specificarea valorilor simbolice în opțiunile „—oem” și „—psm”.
- În cod, funcțiile access și _access au fost înlocuite cu metoda std::filesystem::exists(). Funcțiile tprintf au fost înlocuite cu utilizarea fluxului tesserr.
- Suportul pentru platforma de învățare automată Tensorflow a fost eliminat, aceasta fiind implementată anterior, dar nefolosită pentru execuția modelor AI de recunoaștere.
- Installerul pentru platforma Windows a fost îmbunătățit.
- Submodulul googletest a fost actualizat la versiunea 1.15.2.
Sursa: opennet.ro
