publication du système de reconnaissance optique de caractères , prenant en charge la reconnaissance de caractères UTF-8 et de textes en plus de 100 langues, y compris le russe, le kazakh, le biélorusse et l'ukrainien. Le résultat peut être enregistré en texte brut ou dans des formats HTML (hOCR), ALTO (XML), PDF et TSV. Le système a été initialement créé entre 1985 et 1995 dans un laboratoire de la société Hewlett Packard, le code a été ouvert en 2005 sous licence Apache et a depuis été développé avec la participation d'employés de Google. Les textes sources du projet sous licence Apache 2.0.
Tesseract comprend un utilitaire en ligne de commande et la bibliothèque libtesseract pour intégrer des fonctionnalités de reconnaissance de texte dans d'autres applications. Parmi les interfaces about:support , et . Deux moteurs de reconnaissance sont proposés : le classique, qui reconnaît le texte au niveau des modèles de caractères individuels, et le nouveau, basé sur l'application d'un système d'apprentissage automatique utilisant un réseau de neurones récurrent LSTM, optimisé pour la reconnaissance de lignes entières et permettant d'obtenir une précision considérablement accrue. Des modèles pré-entraînés sont publiés pour . Pour optimiser les performances, des modules utilisant OpenMP et des instructions SIMD AVX2, AVX ou SSE4.1 sont proposés.
Principales dans Tesseract 4.1 :
- Ajout de la possibilité d'exporter au format XML (Analyzed Layout and Text Object). Pour utiliser ce format, il faut lancer l'application avec « tesseract nom_image dossier_sortie alto » ;
- Ajout de nouveaux modules de rendu LSTMBox et WordStrBox, simplifiant l'apprentissage du moteur ;
- Ajout de la prise en charge des graphiques ASCII dans la sortie hOCR (HTML) ;
- Ajout de scripts alternatifs écrits en Python pour entraîner le moteur basé sur l'apprentissage automatique ;
- Optimisations étendues utilisant les instructions AVX, AVX2 et SSE ;
- Le support OpenMP est désactivé par défaut en raison de problèmes de performance ;
- Dans le moteur LSTM, ajout de la prise en charge des listes blanches et noires ;
- Amélioration des scripts de construction basés sur Cmake.
Source : opennet.ru
