Die Veröffentlichung des Systems für optische Zeichenerkennung Tesseract 5.1, das die Erkennung von UTF-8-Zeichen und Texten in mehr als 100 Sprachen unterstützt, einschließlich Russisch, Kasachisch, Weißrussisch und Ukrainisch, wurde bekanntgegeben. Die Ergebnisse können sowohl als reiner Text als auch in HTML-Formaten (hOCR), ALTO (XML), PDF und TSV gespeichert werden. Ursprünglich wurde das System in den Jahren 1985-1995 im Labor des Unternehmens Hewlett Packard entwickelt; 2005 wurde der Code unter der Apache-Lizenz freigegeben und später mit Beteiligung von Mitarbeitern von Google weiterentwickelt. Die ursprünglichen Projekttexte werden unter der Lizenz Apache 2.0 verbreitet.
Tesseract umfasst ein Konsolen-Dienstprogramm und die Bibliothek libtesseract, um Texterkennungsfunktionen in andere Anwendungen zu integrieren. Zu den unterstützenden GUI-Schnittstellen für Tesseract gehören gImageReader, VietOCR und YAGF. Es werden zwei Erkennungsengines angeboten: die klassische, die Zeichen auf der Grundlage von Vorlagen erkennt, und die neue, die auf einem maschinellen Lernsystem auf der Basis eines rekurrenten neuronalen Netzwerks (LSTM) basiert, das für die Erkennung ganzer Zeilen optimiert ist und eine erhebliche Verbesserung der Genauigkeit ermöglicht. Vorgefertigte, trainierte Modelle wurden für 123 Sprachen veröffentlicht. Zur Optimierung der Leistung werden Module angeboten, die OpenMP und SIMD-Anweisungen wie AVX2, AVX, NEON oder SSE4.1 nutzen.
Die wichtigsten Verbesserungen in Tesseract 5.1:
- Die Möglichkeit zur Verarbeitung von Bereichen mit Bildern und Linien beim Export in ALTO-, hOCR- und Textformaten wurde implementiert.
- Ein neuer Parameter curl_timeout lkz curl_easy_setop wurde hinzugefügt.
- Das Builds-System wurde verbessert.
- Die Arbeit zur Entfernung von nicht verwendetem Code wurde durchgeführt.
- Abstürze, die durch eine fehlerhafte Verarbeitung von Nullzeigern in der Klasse PageIterator::Orientation verursacht wurden, wurden behoben.
Quelle: opennet.ru
