È stato pubblicato il rilascio del sistema di riconoscimento ottico dei caratteri Tesseract 5.4.0, che supporta il riconoscimento dei caratteri UTF-8 e testi in oltre 100 lingue, tra cui russo, kazako, bielorusso e ucraino. I risultati possono essere salvati sia come testo semplice che in formati HTML (hOCR), ALTO (XML), PDF e TSV. Inizialmente, il sistema è stato creato tra il 1985 e il 1995 nel laboratorio della Hewlett Packard, nel 2005 il codice è stato reso open source sotto licenza Apache e successivamente è stato sviluppato con la partecipazione di dipendenti della Google. I testi sorgente del progetto sono distribuiti sotto licenza Apache 2.0.
Tesseract include una utility da console e una libreria libtesseract per integrare funzioni di riconoscimento del testo in altre applicazioni. Tra le interfacce GUI di terze parti che supportano Tesseract, si possono menzionare gImageReader, VietOCR e YAGF. Sono disponibili due motori di riconoscimento: quello classico, che riconosce il testo a livello di modelli di singoli caratteri, e il nuovo, basato sull'applicazione di un sistema di machine learning tramite una rete neurale ricorrente LSTM, ottimizzato per il riconoscimento di intere righe e che consente un significativo aumento della precisione. Modelli pre-addestrati sono stati pubblicati per 123 lingue. Per ottimizzare le prestazioni, sono disponibili moduli che utilizzano OpenMP e istruzioni SIMD AVX2, AVX, AVX512F, NEON o SSE4.1.
Miglioramenti principali:
- Aggiunta la supporto per il rendering e l'esportazione in formato PAGE-XML.
- Implementata la possibilità di addestrare il modello utilizzando file in formato PNG anziché file LSTMF.
- Migliorato il rendering in formato PDF.
- Espanso l'API per la determinazione dell'inclinazione del testo.
- Risolti problemi di prestazioni riscontrati durante la scansione nel sistema Coverity.
Fonte: opennet.ru
