È stata pubblicata la versione 5.5.0 del sistema di riconoscimento ottico dei caratteri Tesseract, che supporta Unicode e il riconoscimento di testi in oltre 100 lingue, tra cui russo, kazako, bielorusso e ucraino. I risultati possono essere salvati sia come testo semplice sia in formati HTML (hOCR), ALTO (XML), PDF e TSV. Il sistema è stato originariamente creato tra il 1985 e il 1995 nel laboratorio dell'azienda Hewlett Packard, e nel 2005 il codice è stato reso pubblico sotto licenza Apache, continuando a essere sviluppato con la partecipazione dei dipendenti di Google. I testi sorgente del progetto sono distribuiti sotto licenza Apache 2.0.
Tesseract include un'utilità da console e una libreria libtesseract per integrare funzioni di riconoscimento del testo in altre applicazioni. Tra le interfacce GUI di terze parti che supportano Tesseract, si possono notare gImageReader, VietOCR e YAGF. Sono offerti due motori di riconoscimento: il classico, che riconosce il testo a livello di modelli di singoli caratteri, e il nuovo, basato su un sistema di machine learning con rete neurale ricorrente LSTM, ottimizzato per il riconoscimento di intere righe e che consente un notevole aumento della precisione. Modelli pre-addestrati sono disponibili per 123 lingue. Per ottimizzare le performance, vengono forniti moduli che utilizzano OpenMP e istruzioni SIMD AVX2, AVX, AVX512F, NEON o SSE4.1.
Miglioramenti principali:
- Aggiunta la compatibilità per le estensioni vettoriali RISC-V V, su cui sono state preparate ottimizzazioni in assembler per sistemi con processori RISC-V.
- Durante la registrazione del risultato in formato hOCR, viene garantita l'impostazione nei file creati dei parametri ocrp_dir e ocrp_lang.
- Il codice è stato modernizzato per determinare i modelli linguistici disponibili.
- Il codice per la generazione di file in formato hOCR è stato migliorato e la conversione dei nomi dei file sulla piattaforma Windows è stata rimossa.
- Consente di specificare valori simbolici nelle opzioni «—oem» e «—psm».
- Nel codice, le funzioni access e _access sono state sostituite con il metodo std::filesystem::exists(). Le funzioni tprintf sono state sostituite con l'uso dello stream tesserr.
- È stata rimossa il supporto per la piattaforma di machine learning Tensorflow, che era stata implementata, ma non è mai stata utilizzata per eseguire modelli AI di riconoscimento.
- Installer per la piattaforma Windows migliorato.
- Il sottogruppo googletest è stato aggiornato alla versione 1.15.2.
Fonte: opennet.ru
