È stato pubblicato il rilascio del sistema di riconoscimento ottico dei caratteri Tesseract 5.1, che supporta il riconoscimento di caratteri UTF-8 e testi in oltre 100 lingue, comprese il russo, il kazaco, il bielorusso e l'ucraino. I risultati possono essere salvati sia come testo semplice, sia nei formati HTML (hOCR), ALTO (XML), PDF e TSV. Inizialmente, il sistema è stato creato tra il 1985 e il 1995 nel laboratorio della Hewlett Packard, nel 2005 il codice è stato reso pubblico con licenza Apache e successivamente è stato sviluppato con la partecipazione dei dipendenti di Google. I testi sorgente del progetto sono distribuiti con licenza Apache 2.0.
Tesseract include un'utilità da console e una libreria libtesseract per integrare le funzioni di riconoscimento del testo in altre applicazioni. Tra le interfacce GUI di terze parti che supportano Tesseract, si possono citare gImageReader, VietOCR e YAGF. Sono disponibili due motori di riconoscimento: uno classico, che riconosce il testo a livello di modelli di singoli caratteri, e un nuovo motore che sfrutta un sistema di apprendimento automatico basato su una rete neurale ricorrente LSTM, ottimizzato per il riconoscimento di intere righe, consentendo di ottenere un notevole aumento della precisione. Modelli già addestrati sono stati pubblicati per 123 lingue. Per ottimizzare le prestazioni, vengono proposti moduli che utilizzano OpenMP e istruzioni SIMD AVX2, AVX, NEON o SSE4.1.
Principali miglioramenti in Tesseract 5.1:
- È stata implementata la possibilità di elaborare aree con immagini e linee nell'output nei formati ALTO, hOCR e testo.
- Aggiunto un nuovo parametro curl_timeout lkz curl_easy_setop.
- Migliorato il sistema di build.
- Effettuato il lavoro per rimuovere codice non utilizzato.
- Risolti i crash causati da un'elaborazione errata dei puntatori nulli nella classe PageIterator::Orientation.
Fonte: opennet.ru
