Tesseract 4.1 tekstituvastussüsteemi väljaanne
Valmis on saanud Tesseract 4.1 optilise tekstide tuvastamise süsteemi versioon, mis toetab UTF-8 tähemärkide tuvastamist ja rohkem kui 100 keele, sealhulgas vene, kasahhi, valgevene ja ukraina, tekste. Tulemusi saab salvestada nii avatud tekstina kui ka formaatides HTML (hOCR), ALTO (XML), PDF ja TSV. Alguses loodi süsteem aastatel 1985-1995 Hewlett Packardi laboratooriumis, […]
