Der Release des optischen Texterkennungssystems Tesseract 5.5.0 wurde veröffentlicht. Es unterstützt Unicode und die Erkennung von Texten in mehr als 100 Sprachen, einschließlich Russisch, Kasachisch, Weißrussisch und Ukrainisch. Die Ergebnisse können als reiner Text oder in den Formaten HTML (hOCR), ALTO (XML), PDF und TSV gespeichert werden. Ursprünglich wurde das System zwischen 1985 und 1995 im Labor der Hewlett Packard entwickelt; im Jahr 2005 wurde der Code unter der Apache-Lizenz veröffentlicht und anschließend mit Beteiligung von Mitarbeitern von Google weiterentwickelt. Die Quelltexte des Projekts werden unter der Lizenz Apache 2.0 verbreitet.
Tesseract umfasst ein Konsolenwerkzeug sowie die Bibliothek libtesseract, um Texterkennungsfunktionen in andere Anwendungen zu integrieren. Zu den unterstützten Tesseract-GUI-Interfaces gehören gImageReader, VietOCR und YAGF. Es werden zwei Erkennungs-Engines angeboten: die klassische, die Zeichen auf der Grundlage von Mustern erkennt, und die neue, die auf einem maschinellen Lernsystem mit rekursiven neuronalen Netzwerken (LSTM) basiert. Diese ist darauf optimiert, ganze Zeilen zu erkennen und ermöglicht eine signifikante Steigerung der Genauigkeit. Bereits trainierte Modelle sind für 123 Sprachen veröffentlicht. Zur Optimierung der Leistung stehen Module zur Verfügung, die OpenMP sowie SIMD-Instruktionen wie AVX2, AVX, AVX512F, NEON oder SSE4.1 nutzen.
Wesentliche Verbesserungen:
- Die Unterstützung für die Vektor-erweiterungen RISC-V V wurde hinzugefügt, auf deren Grundlage Assembly-Optimierungen für Systeme mit RISC-V-Prozessoren vorbereitet wurden.
- Beim Speichern des Ergebnisses im hOCR-Format werden die Parameter ocrp_dir und ocrp_lang in der erstellten Datei eingestellt.
- Der Code zur Erkennung verfügbarer Sprachmodelle wurde modernisiert.
- Der Code zur Erstellung von Dateien im hOCR-Format wurde verbessert und die Umbenennung von Dateien auf der Windows-Plattform entfernt.
- Es ist jetzt möglich, symbolische Werte in den Optionen „—oem“ und „—psm“ anzugeben.
- Im Code wurden die Funktionen access und _access durch die Methode std::filesystem::exists() ersetzt. Die Funktionen tprintf wurden durch die Verwendung des tesserr-Streams ersetzt.
- Die Unterstützung der Machine-Learning-Plattform Tensorflow wurde entfernt, die ursprünglich implementiert, aber nie zur Ausführung von KI-Modellen zur Erkennung verwendet wurde.
- Der Installer für die Windows-Plattform wurde verbessert.
- Das Submodul googletest wurde auf Version 1.15.2 aktualisiert.
Quelle: opennet.ru
