Die Veröffentlichung des Systems zur optischen Texterkennung Tesseract 5.2, das die Erkennung von UTF-8-Zeichen und Texten in mehr als 100 Sprachen, darunter Russisch, Kasachisch, Weißrussisch und Ukrainisch, unterstützt, ist erfolgt. Ergebnisse können sowohl als reiner Text als auch in den Formaten HTML (hOCR), ALTO (XML), PDF und TSV gespeichert werden. Ursprünglich wurde das System in den Jahren 1985-1995 im Labor von Hewlett Packard entwickelt, im Jahr 2005 wurde der Code unter der Apache-Lizenz freigegeben und entwickelte sich mit Unterstützung von Mitarbeitern von Google weiter. Die Quelltexte des Projekts werden unter der Lizenz Apache 2.0 verbreitet.
Tesseract beinhaltet ein Konsolen-Utility und die Bibliothek libtesseract zur Integration von Textanerkennungsfunktionen in andere Anwendungen. Zu den unterstützenden GUI-Schnittstellen von Drittanbietern für Tesseract gehören gImageReader, VietOCR und YAGF. Es werden zwei Erkennungs-Engines angeboten: eine klassische, die Text auf der Grundlage von Mustern einzelner Zeichen erkennt, und eine neue, die auf einem maschinellen Lernsystem mit rekurrenten neuronalen Netzwerken (LSTM) basiert, das für die Erkennung ganzer Zeilen optimiert ist und zu einem signifikanten Anstieg der Genauigkeit führt. Fertige trainierte Modelle sind für 123 Sprachen veröffentlicht worden. Zur Optimierung der Leistung werden Module angeboten, die OpenMP und SIMD-Befehle wie AVX2, AVX, AVX512F, NEON oder SSE4.1 verwenden.
Die Hauptverbesserungen in Tesseract 5.2:
- Optimierungen wurden implementiert, die unter Verwendung von Intel AVX512F-Instruktionen realisiert wurden.
- Im C-API wurde eine Funktion zur Initialisierung von Tesseract mit dem Laden von Modellen aus dem Speicher eingeführt.
- Der Parameter invert_threshold wurde hinzugefügt, der den Grad der Umkehrung von Textzeilen bestimmt. Standardmäßig ist der Wert auf 0,7 gesetzt. Um die Umkehrung zu deaktivieren, sollte der Wert auf 0 gesetzt werden.
- Die Verarbeitung sehr großer Dokumente auf 32-Bit-Hosts wurde verbessert.
- Der Übergang von der Verwendung von std::regex zu std::string wurde vollzogen.
- Die Build-Skripte für Autotools, CMake und Continuous Integration-Systeme wurden verbessert.
Quelle: opennet.ru
