ĂshtĂ« publikuar versioni 5.5.0 i sistemit tĂ« njohjes optike tĂ« tekstit Tesseract, i cili mbĂ«shtet Unicode dhe njohjen e teksteve nĂ« mĂ« shumĂ« se 100 gjuhĂ«, pĂ«rfshirĂ« rusishten, kazakishten, bjellorusishten dhe ukrainishten. Rezultati mund tĂ« ruhet si tekst i thjeshtĂ«, ashtu edhe nĂ« formatet HTML (hOCR), ALTO (XML), PDF dhe TSV. Fillimisht, sistemi u krijua nĂ« vitet 1985-1995 nĂ« laboratorin e kompanisĂ« Hewlett Packard; nĂ« vitin 2005 kodi u hap nĂ«n licencĂ«n Apache dhe mĂ« pas u zhvillua me pjesĂ«marrjen e punonjĂ«sve tĂ« Google. Kodet burimore tĂ« projektit shpĂ«rndahen nĂ«n licencĂ«n Apache 2.0.
Tesseract përfshin një mjet konzole dhe bibliotekën libtesseract për integrimin e funksioneve të njohjes së tekstit në aplikacione të tjera. Ndër ndërfaqet GUI të palëve të treta që mbështesin Tesseract mund të përmenden gImageReader, VietOCR dhe YAGF. Ofron dy engine njohjeje: klasik, që njeh tekstin në nivel shabllonesh të karaktereve individuale, dhe një të ri, të bazuar në përdorimin e një sistemi machine learning mbi rrjetin nervor rekurent LSTM, të optimizuar për njohjen e rreshtave të plotë dhe që lejon rritje të ndjeshme të saktësisë. Janë publikuar modele të gatshme të trajnuara për 123 gjuhë. Për optimizimin e performancës ofrohen module që përdorin OpenMP dhe instruksionet SIMD AVX2, AVX, AVX512F, NEON ose SSE4.1.
Përmirësimet kryesore:
- ĂshtĂ« shtuar mbĂ«shtetja pĂ«r zgjerimet vektoriale RISC-V V, mbi bazĂ«n e tĂ« cilave janĂ« pĂ«rgatitur optimizime nĂ« assembler pĂ«r sistemet me procesorĂ« RISC-V.
- Gjatë ruajtjes së rezultatit në formatin hOCR, sigurohet vendosja e parametrave ocrp_dir dhe ocrp_lang në skedarin e krijuar.
- ĂshtĂ« modernizuar kodi pĂ«r pĂ«rcaktimin e modeleve tĂ« disponueshme gjuhĂ«sore.
- ĂshtĂ« pĂ«rmirĂ«suar kodi pĂ«r krijimin e skedarĂ«ve nĂ« formatin hOCR dhe Ă«shtĂ« hequr transformimi i emrave tĂ« skedarĂ«ve nĂ« platformĂ«n Windows.
- Lejohet specifikimi i vlerave tekstuale nĂ« opsionet «âoem» dhe «âpsm».
- Në kod janë zëvendësuar funksionet access dhe _access me metodën std::filesystem::exists(). Funksionet tprintf janë zëvendësuar me përdorimin e rrjedhës tesserr.
- ĂshtĂ« hequr mbĂ«shtetja pĂ«r platformĂ«n e machine learning Tensorflow, e cila dikur ishte implementuar, por nuk u pĂ«rdor kurrĂ« pĂ«r ekzekutimin e modeleve AI tĂ« njohjes.
- ĂshtĂ« pĂ«rmirĂ«suar instaluesi pĂ«r platformĂ«n Windows.
- Nënmoduli googletest është përditësuar në versionin 1.15.2.
Burimi: opennet.ru
