Sortie du système de reconnaissance de texte Tesseract 5.2

La version du système de reconnaissance optique de caractères Tesseract 5.2 a été publiée, prenant en charge la reconnaissance des caractères UTF-8 et des textes en plus de 100 langues, y compris le russe, le kazakh, le biélorusse et l'ukrainien. Le résultat peut être enregistré à la fois en texte brut et dans les formats HTML (hOCR), ALTO (XML), PDF et TSV. À l'origine, le système a été créé entre 1985 et 1995 dans le laboratoire de la société Hewlett Packard, en 2005, le code a été rendu public sous licence Apache et a ensuite été développé avec l'aide d'employés de Google. Les textes sources du projet sont distribués sous la licence Apache 2.0.

Tesseract inclut un utilitaire en ligne de commande et une bibliothèque libtesseract pour intégrer des fonctions de reconnaissance de texte dans d'autres applications. Parmi les interfaces GUI tierces prenant en charge Tesseract, on peut citer gImageReader, VietOCR et YAGF. Deux moteurs de reconnaissance sont proposés : un classique, qui reconnaît le texte à un niveau d'échantillonnage des caractères individuels, et un nouveau, basé sur l'utilisation d'un système d'apprentissage machine avec un réseau de neurones récurrent LSTM, optimisé pour reconnaître des lignes entières et permettant d'obtenir une précision significativement améliorée. Des modèles pré-entraînés sont publiés pour 123 langues. Pour optimiser les performances, des modules utilisant OpenMP et des instructions SIMD AVX2, AVX, AVX512F, NEON ou SSE4.1 sont proposés.

Améliorations principales dans Tesseract 5.2 :

  • Des optimisations ont été ajoutées, réalisées à l'aide des instructions Intel AVX512F.
  • Une fonction pour initialiser Tesseract avec un chargement depuis la mémoire du modèle d'apprentissage automatique a été réalisée dans l'API C.
  • Un paramètre invert_threshold a été ajouté, définissant le niveau d'inversion des lignes de texte. Par défaut, la valeur est de 0.7. Pour désactiver l'inversion, il convient de définir la valeur à 0.
  • Le traitement de documents très volumineux sur des hôtes 32 bits a été amélioré.
  • La transition de l'utilisation des fonctions std::regex vers std::string a été effectuée.
  • Les scripts de compilation pour Autotools, CMake et les systèmes d'intégration continue ont été améliorés.

    Source : opennet.ru

Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster