Pubblicato il rilascio del sistema di riconoscimento ottico dei caratteri Tesseract 5.5.0, che supporta Unicode e il riconoscimento di testi in oltre 100 lingue, tra cui russo, kazako, bielorusso e ucraino. I risultati possono essere salvati sia come testo semplice, sia nei formati HTML (hOCR), ALTO (XML), PDF e TSV. Il sistema è stato originariamente creato nel periodo 1985-1995 nei laboratori della Hewlett Packard; nel 2005, il codice è stato reso pubblico sotto licenza Apache e successivamente sviluppato con la partecipazione di dipendenti di Google. I testi sorgente del progetto sono distribuiti sotto licenza Apache 2.0.
Tesseract include un'utilità da riga di comando e la libreria libtesseract per integrare le funzioni di riconoscimento del testo in altre applicazioni. Tra le interfacce GUI di terze parti che supportano Tesseract, si possono citare gImageReader, VietOCR e YAGF. Sono disponibili due motori di riconoscimento: il classico, che riconosce il testo a livello di modelli di singoli caratteri, e il nuovo, basato su un sistema di apprendimento automatico con rete neurale ricorrente LSTM, ottimizzato per il riconoscimento di intere righe e in grado di migliorare significativamente la precisione. I modelli addestrati sono pubblicati per 123 lingue. Per ottimizzare le prestazioni, sono disponibili moduli che utilizzano OpenMP e istruzioni SIMD AVX2, AVX, AVX512F, NEON o SSE4.1.
Principali miglioramenti:
- Aggiunto supporto per le estensioni vettoriali RISC-V V, su cui sono state preparate ottimizzazioni in assemblea per i sistemi con processori RISC-V.
- Durante la scrittura del risultato nel formato hOCR, sono stati impostati nel file creato i parametri ocrp_dir e ocrp_lang.
- Il codice per la determinazione dei modelli linguistici disponibili è stato aggiornato.
- Migliorato il codice per la generazione di file nel formato hOCR e rimosso la conversione dei nomi file sulla piattaforma Windows.
- Consentito l'uso di valori simbolici nelle opzioni "—oem" e "—psm".
- Nel codice sono state sostituite le funzioni access e _access con il metodo std::filesystem::exists(). Le funzioni tprintf sono state sostituite con l'uso del flusso tesserr.
- Rimossa la supporto per la piattaforma di machine learning Tensorflow, che era stata implementata ma non è mai stata utilizzata per eseguire modelli AI di riconoscimento.
- Installatore migliorato per la piattaforma Windows.
- Sottomodulo googletest aggiornato alla versione 1.15.2.
Fonte: opennet.ru
