La sortie du système de reconnaissance optique de caractères Tesseract 5.1 a été publiée, prenant en charge la reconnaissance des caractères UTF-8 et des textes dans plus de 100 langues, y compris le russe, le kazakh, le biélorusse et l'ukrainien. Les résultats peuvent être enregistrés en tant que texte brut ou dans les formats HTML (hOCR), ALTO (XML), PDF et TSV. À l'origine, le système a été créé entre 1985 et 1995 dans un laboratoire de la société Hewlett Packard, et en 2005, le code a été rendu open source sous la licence Apache et a ensuite été développé avec la participation des employés de Google. Les sources du projet sont distribuées sous la licence Apache 2.0.
Tesseract comprend une utilitaire en console et une bibliothèque libtesseract pour intégrer des fonctionnalités de reconnaissance de texte dans d'autres applications. Parmi les interfaces GUI tierces supportant Tesseract, on peut noter gImageReader, VietOCR et YAGF. Deux moteurs de reconnaissance sont proposés : l'un classique, qui reconnaît le texte au niveau des modèles de caractères individuels, et l'autre, basé sur l'application d'un système d'apprentissage machine utilisant un réseau de neurones récurrents LSTM, optimisé pour reconnaître des lignes entières et permettant d'atteindre une précision significativement améliorée. Des modèles pré-entraînés sont publiés pour 123 langues. Pour optimiser les performances, des modules utilisant OpenMP et des instructions SIMD AVX2, AVX, NEON ou SSE4.1 sont proposés.
Améliorations principales de Tesseract 5.1 :
- Il est désormais possible de traiter des zones avec des images et des lignes lors de l'exportation dans les formats ALTO, hOCR et texte.
- Un nouveau paramètre curl_timeout a été ajouté à curl_easy_setop.
- Amélioration du système de compilation.
- Des efforts ont été faits pour supprimer le code inutilisé.
- Des plantages causés par un traitement incorrect des pointeurs nuls dans la classe PageIterator::Orientation ont été corrigés.
Source : opennet.ru
