È stato pubblicato il rilascio del sistema di riconoscimento ottico dei caratteri Tesseract 5.4.0, che supporta il riconoscimento dei caratteri UTF-8 e testi in oltre 100 lingue, tra cui russo, kazako, bielorusso e ucraino. Il risultato può essere salvato sia come testo aperto che nei formati HTML (hOCR), ALTO (XML), PDF e TSV. Inizialmente, il sistema è stato creato tra il 1985 e il 1995 nel laboratorio della Hewlett Packard; nel 2005, il codice è stato aperto sotto licenza Apache e successivamente sviluppato con la partecipazione dei dipendenti di Google. I testi sorgente del progetto sono distribuiti sotto licenza Apache 2.0.
Tesseract include un'utilità da riga di comando e la libreria libtesseract per integrare le funzioni di riconoscimento del testo in altre applicazioni. Tra le interfacce GUI di terze parti che supportano Tesseract si possono citare gImageReader, VietOCR e YAGF. Sono offerti due motori di riconoscimento: uno classico, che riconosce il testo a livello di modelli di singoli caratteri, e uno nuovo, basato sull'applicazione di un sistema di apprendimento automatico con rete neurale ricorrente LSTM, ottimizzato per il riconoscimento di intere righe e in grado di aumentare significativamente la precisione. Modelli già addestrati sono stati pubblicati per 123 lingue. Per ottimizzare le prestazioni, sono disponibili moduli che utilizzano OpenMP e istruzioni SIMD AVX2, AVX, AVX512F, NEON o SSE4.1.
Principali miglioramenti:
- Aggiunta la supporto per il rendering e l'esportazione nel formato PAGE-XML.
- Implementata la possibilità di addestrare il modello utilizzando file in formato PNG invece di file LSTMF.
- Migliorato il rendering nel formato PDF.
- Espanso API per la rilevazione dell'inclinazione del testo.
- Risolvibili problemi di prestazioni rilevati durante la scansione nel sistema Coverity.
Fonte: opennet.ru
