Tesseract 5.4.0 tekstituvastussüsteemi väljaanne

Tesseract 5.4.0 versiooni vabastamine, mis toetab UTF-8 sümbolite tuvastamist ja tuvastab tekste üle 100 keele, sealhulgas vene, kasahhi, valgevene ja ukraina. Tulemusi saab salvestada nii avatud tekstina kui ka formaatides HTML (hOCR), ALTO (XML), PDF ja TSV. Algset süsteemi arendati 1985–1995. aastatel Hewlett Packardi laboratooriumis, 2005. aastal avati kood Apache litsentsi all ja hiljem arendasid seda edasi Google'i töötajad. Projekti allikaid levitatakse Apache 2.0 litsentsi alla.

Tesseract sisaldab käsurealiidese tööriista ja raamatukogu libtesseract, et sisestada tekstituvastusfunktsioone teistesse rakendustesse. Tesseracti toetavate kolmandate osapoolte GUI-de seas võib välja tuua gImageReader, VietOCR ja YAGF. Pakutakse kahte tekstituvastusmootorit: klassikaline, mis tunneb ära tähemärgid eraldi mallide tasandil, ja uus, mis põhineb masinõppes, kasutades korduvaid närvivõrke LSTM, mis on optimeeritud kogu ridade äratundmiseks ja võimaldab oluliselt parandada täpsust. Valmis treenitud mudeleid on avaldatud 123 keele jaoks. Jõudluse optimeerimiseks on pakutud mooduleid, mis kasutavad OpenMP ja SIMD-instruktsioone AVX2, AVX, AVX512F, NEON või SSE4.1.

Peamised parandused:

  • Lisatud tugi renderdamiseks ja eksportimiseks PAGE-XML formaatis.
  • Rakendatud võimalus treenida mudelit, kasutades PNG formaadis faile LSTMF failide asemel.
  • Parandatud renderdamist PDF formaati.
  • Laienenud API teksti kallutuse määramiseks.
  • Parandatud jõudlusprobleemid, mis tuvastati Coverity süsteemis skaneerimise käigus.

Allikas: opennet.ru

Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid 🔥 Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid | ProHoster