Lëshimi i sistemit të njohjes së tekstit Tesseract 5.1

Ështe publikuar lĂ«shimi i sistemit tĂ« njohjes optike tĂ« teksteve Tesseract 5.1, qĂ« mbĂ«shtet njohjen e simboleve UTF-8 dhe teksteve nĂ« mĂ« shumĂ« se 100 gjuhĂ«, pĂ«rfshirĂ« rusishten, kazakishten, bjellorusishten dhe ukrainishten. Rezultati mund tĂ« ruhet si tekst i hapur ashtu edhe nĂ« formate HTML (hOCR), ALTO (XML), PDF dhe TSV. Fillimisht, sistemi u krijua nĂ« vitet 1985-1995 nĂ« laboratorin e kompanisĂ« Hewlett Packard, dhe nĂ« vitin 2005 kodi u hap nĂ«n licencĂ«n Apache dhe mĂ« pas u zhvillua me ndihmĂ«n e punonjĂ«sve tĂ« kompanisĂ« Google. Tekstet origjinale tĂ« projektit shpĂ«rndahen nĂ«n licencĂ«n Apache 2.0.

Tesseract përfshin një utilitar të konsolës dhe bibliotekën libtesseract për të integruar funksionet e njohjes së tekstit në aplikacione të tjera. Disa nga GUI-të e treta që mbështesin Tesseract janë gImageReader, VietOCR dhe YAGF. Ofron dy motorë njohjeje: klasik, që njeh tekstin në nivelin e shablloneve të karaktereve individuale, dhe një të ri, i bazuar në sistemin e mësimit të makinerisë me rrjetin nervor rekurent LSTM, i optimizuar për të njohur rreshta të tërë dhe që lejon një rritje të konsiderueshme të saktësisë. Modelet e trajnuara janë publikuar për 123 gjuhë. Për të optimizuar performancën, ofrohen module që përdorin OpenMP dhe instruksione SIMD AVX2, AVX, NEON, ose SSE4.1.

Përmirësimet kryesore në Tesseract 5.1:

  • ËshtĂ« realizuar mundĂ«sia e pĂ«rpunimit tĂ« zonave me imazhe dhe linja gjatĂ« daljes nĂ« formatet ALTO, hOCR dhe tekst.
  • ËshtĂ« shtuar njĂ« parametr i ri curl_timeout lkz curl_easy_setop.
  • ËshtĂ« pĂ«rmirĂ«suar sistemi i ndĂ«rtimit.
  • ËshtĂ« bĂ«rĂ« punĂ« pĂ«r tĂ« eliminuar kodin e pa pĂ«rdorur.
  • JanĂ« eliminuar çarjet e shkaktuara nga pĂ«rpunimi i gabuar i treguesve tĂ« null nĂ« klasĂ«n PageIterator::Orientation.

Burimi: opennet.ru

Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster