rilascio del sistema di riconoscimento ottico dei testi , che supporta il riconoscimento di caratteri UTF-8 e testi in oltre 100 lingue, inclusi russo, kazako, bielorusso e ucraino. I risultati possono essere salvati come testo semplice o nei formati HTML (hOCR), ALTO (XML), PDF e TSV. Il sistema è stato originariamente sviluppato tra il 1985 e il 1995 nel laboratorio della Hewlett Packard, e nel 2005 il codice è stato reso open source sotto licenza Apache, continuando a svilupparsi con il contributo di Google. I testi sorgente del progetto sotto licenza Apache 2.0.
Tesseract include un'utilità da riga di comando e una libreria libtesseract per integrare le funzionalità di riconoscimento del testo in altre applicazioni. Tra le interfacce GUI di terze parti che supportano Tesseract gImageReader , e . Sono disponibili due motori di riconoscimento: uno classico, che riconosce il testo a livello di modelli di singoli caratteri, e uno nuovo, che si basa su un sistema di apprendimento automatico con rete neurale ricorrente LSTM, ottimizzato per riconoscere intere linee e consentire un significativo aumento della precisione. I modelli addestrati sono pubblicati per . Per ottimizzare le prestazioni, sono disponibili moduli che utilizzano OpenMP e istruzioni SIMD AVX2, AVX o SSE4.1.
Principali in Tesseract 4.1:
- Aggiunta la possibilità di output in formato XML (Analyzed Layout and Text Object). Per utilizzare questo formato, eseguire l'applicazione come «tessaract nome_immagine cartella_output alto»;
- Aggiunti nuovi moduli di rendering LSTMBox e WordStrBox che semplificano la formazione del motore;
- Aggiunta supporto per pseudografica nell'output hOCR (HTML);
- Aggiunti script alternativi in Python per l'addestramento del motore basato su apprendimento automatico;
- Ampliate le ottimizzazioni utilizzando istruzioni AVX, AVX2 e SSE;
- Il supporto per OpenMP è disabilitato per impostazione predefinita a causa delle prestazioni;
- Nel motore LSTM è stata aggiunta la gestione di liste bianche e nere;
- Migliorati gli script di compilazione basati su Cmake.
Fonte: opennet.ru
