ĂshtĂ« publikuar lĂ«shimi i sistemit tĂ« njohjes optike tĂ« tekstit Tesseract 5.4.0, qĂ« mbĂ«shtet njohjen e simboleve UTF-8 dhe teksteve nĂ« mĂ« shumĂ« se 100 gjuhĂ«, duke pĂ«rfshirĂ« rusisht, kazakisht, bjellorusisht dhe ukrainisht. Rezultati mund tĂ« ruhet si tekst i hapur, ashtu si dhe nĂ« formate HTML (hOCR), ALTO (XML), PDF dhe TSV. Fillimisht, sistemi u krijua nĂ« vitet 1985-1995 nĂ« laboratorin e kompanisĂ« Hewlett Packard, nĂ« vitin 2005 kodi u hap nĂ«n licencĂ«n Apache dhe mĂ« pas u zhvillua me pjesĂ«marrjen e punonjĂ«sve tĂ« kompanisĂ« Google. Tekstet burimore tĂ« projektit shpĂ«rndahen nĂ«n licencĂ«n Apache 2.0.
Tesseract përfshin një utilitar konsolë dhe bibliotekën libtesseract për të integruar funksionet e njohjes së tekstit në aplikacione të tjera. Midis ndërfaqeve GUI të palëve të treta që mbështesin Tesseract, mund të përmendim gImageReader, VietOCR dhe YAGF. Ofron dy motorë njohjeje: klasikun, që njeh tekstin në nivelin e çelësve individualë, dhe të riun, i cili bazohet në përdorimin e një sistemi të mësimit të makinerisë të bazuar në një rrjet neural rekurent LSTM, i optimizuar për të njohur rreshta të tërë dhe që lejon një rritje të konsiderueshme të saktësisë. Modelet e stërvitura janë publikuar për 123 gjuhë. Për optimizimin e performancës, ofrohen module që përdorin OpenMP dhe instrukcione SIMD AVX2, AVX, AVX512F, NEON ose SSE4.1.
Përmirësimet kryesore:
- ĂshtĂ« shtuar mbĂ«shtetja pĂ«r vizatimin dhe eksportin nĂ« formatin PAGE-XML.
- ĂshtĂ« realizuar mundĂ«sia pĂ«r trajnimin e modelit, duke pĂ«rdorur skedarĂ« nĂ« formatin PNG nĂ« vend tĂ« skedarĂ«ve LSTMF.
- ĂshtĂ« pĂ«rmirĂ«suar vizatimi nĂ« formatin PDF.
- ĂshtĂ« zgjeruar API-ja pĂ«r pĂ«rcaktimin e kĂ«ndit tĂ« tekstit.
- Janë eliminuar problemet me performancën, të identifikuara gjatë skanimit në sistemin Coverity.
Burimi: opennet.ru
