Lëshimi i sistemit të njohjes së tekstit Tesseract 5.4.0

ËshtĂ« publikuar lĂ«shimi i sistemit tĂ« njohjes optike tĂ« tekstit Tesseract 5.4.0, i cili mbĂ«shtet njohjen e karaktereve UTF-8 dhe teksteve nĂ« mĂ« shumĂ« se 100 gjuhĂ«, duke pĂ«rfshirĂ« rusishten, kazakishten, bjellorusishten dhe ukrainishten. Rezultati mund tĂ« ruhet si tekst i hapur, ashtu edhe nĂ« formate HTML (hOCR), ALTO (XML), PDF dhe TSV. Fillimisht, sistemi u krijua nĂ« vitet 1985-1995 nĂ« laboratorin e kompanisĂ« Hewlett Packard, nĂ« vitin 2005 kodi u hap nĂ«n licencĂ«n Apache dhe mĂ« vonĂ« u zhvillua me pjesĂ«marrjen e punonjĂ«sve tĂ« kompanisĂ« Google. Tekstet burimore tĂ« projektit shpĂ«rndahen nĂ«n licencĂ«n Apache 2.0.

Tesseract përfshin një mjet konsolë dhe bibliotekën libtesseract për të inkorporuar funksionet e njohjes së tekstit në aplikacione të tjera. Midis GUI-ve të treta që mbështesin Tesseract, përmendim gImageReader, VietOCR dhe YAGF. Oferohen dy motorë njohjeje: një klasik, që njeh tekstin në nivelin e shablloneve të simboleve individuale, dhe një e re, e bazuar në përdorimin e një sistemi të mësimit të makines me rrjetin nervor rekurent LSTM, e optimizuar për njohjen e linjave të plota dhe që lejon një rritje të rëndësishme të saktësisë. Modelet e trajnuara janë publikuar për 123 gjuhë. Për optimizimin e performancës, ofrohen module që përdorin OpenMP dhe instrukcione SIMD AVX2, AVX, AVX512F, NEON ose SSE4.1.

Përmirësimet kryesore:

  • Shtuar mbĂ«shtetje pĂ«r vizatimin dhe eksportin nĂ« formatin PAGE-XML.
  • Realizuar mundĂ«sia e trajnimit tĂ« modelit duke pĂ«rdorur skedarĂ« nĂ« format PNG nĂ« vend tĂ« skedarĂ«ve LSTMF.
  • PĂ«rmirĂ«suar vizatimi nĂ« format PDF.
  • Zgjeruar API pĂ«r pĂ«rcaktimin e kĂ«ndit tĂ« tekstit.
  • Zgjidhur problemet e performancĂ«s qĂ« janĂ« identifikuar gjatĂ« skanimit nĂ« sistemin Coverity.

Burimi: opennet.ru

Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster