Pubblicazione del sistema di riconoscimento del testo Tesseract 5.3.4
È stato pubblicato il rilascio del sistema di riconoscimento ottico dei caratteri Tesseract 5.3.4, che supporta il riconoscimento di caratteri UTF-8 e testi in oltre 100 lingue, tra cui russo, kazako, bielorusso e ucraino. Il risultato può essere salvato sia in formato testo semplice sia in formati HTML (hOCR), ALTO (XML), PDF e TSV. Inizialmente, il sistema è stato creato negli anni 1985-1995 nel laboratorio della Hewlett Packard, in […]
