rilascio del sistema di riconoscimento ottico dei caratteri , supportando il riconoscimento di caratteri UTF-8 e testi in oltre 100 lingue, tra cui russo, kazako, bielorusso e ucraino. Il risultato può essere salvato sia in testo semplice che nei formati HTML (hOCR), ALTO (XML), PDF e TSV. Inizialmente il sistema è stato creato tra il 1985 e il 1995 nel laboratorio della Hewlett Packard, nel 2005 il codice è stato reso open source sotto licenza Apache e in seguito è stato sviluppato con il coinvolgimento di dipendenti di Google. I testi sorgente del progetto sotto licenza Apache 2.0.
Tesseract include un'utilità da console e una libreria libtesseract per integrare le funzioni di riconoscimento del testo in altre applicazioni. Tra i front-end di terze parti che supportano Tesseract about:support , e . Vengono offerti due motori di riconoscimento: il classico, che riconosce il testo a livello di modello di singoli caratteri, e il nuovo, basato sull'applicazione di un sistema di apprendimento automatico con rete neurale ricorrente LSTM, ottimizzato per il riconoscimento di intere righe e che consente un notevole aumento della precisione. Modelli pre-addestrati sono stati pubblicati per . Per ottimizzare le prestazioni sono disponibili moduli che utilizzano OpenMP e istruzioni SIMD AVX2, AVX o SSE4.1.
Principali in Tesseract 4.1:
- È stata aggiunta la possibilità di output in formato XML (Analyzed Layout and Text Object). Per utilizzare questo formato, è necessario avviare l'applicazione come «tesseract nome_immagine catalogo_output alto»;
- Aggiunti nuovi moduli di rendering LSTMBox e WordStrBox, che semplificano l'addestramento del motore;
- Aggiunta la supporto per la grafica pseudo nella visualizzazione hOCR (HTML);
- Aggiunti script alternativi scritti in Python per l'addestramento del motore basato sull'apprendimento automatico;
- Ampliate le ottimizzazioni utilizzando le istruzioni AVX, AVX2 e SSE;
- La supporto per OpenMP è disabilitata per impostazione predefinita a causa delle prestazioni;
- Nel motore LSTM è stato aggiunto il supporto per liste bianche e nere;
- Migliorati gli script di build basati su Cmake.
Fonte: opennet.ru
