Veröffentlichung des Text-Recognition-Systems Tesseract 5.4.0

Die Veröffentlichung des Systems für optische Zeichenerkennung Tesseract 5.4.0, das die Erkennung von UTF-8-Zeichen und Texten in über 100 Sprachen, einschließlich Russisch, Kasachisch, Weißrussisch und Ukrainisch, unterstützt, ist erfolgt. Die Ergebnisse können sowohl als Klartext als auch in den Formaten HTML (hOCR), ALTO (XML), PDF und TSV gespeichert werden. Ursprünglich wurde das System in den Jahren 1985-1995 im Labor von Hewlett Packard entwickelt. Im Jahr 2005 wurde der Code unter der Apache-Lizenz veröffentlicht und später mit der Beteiligung von Google-Mitarbeitern weiterentwickelt. Die Quelltexte des Projekts werden unter der Lizenz Apache 2.0 verteilt.

Tesseract beinhaltet ein Konsolen-Utility und die Bibliothek libtesseract zur Integration von Textanerkennungsfunktionen in andere Anwendungen. Zu den unterstützenden GUI-Schnittstellen von Drittanbietern für Tesseract gehören gImageReader, VietOCR und YAGF. Es werden zwei Erkennungs-Engines angeboten: eine klassische, die Text auf der Grundlage von Mustern einzelner Zeichen erkennt, und eine neue, die auf einem maschinellen Lernsystem mit rekurrenten neuronalen Netzwerken (LSTM) basiert, das für die Erkennung ganzer Zeilen optimiert ist und zu einem signifikanten Anstieg der Genauigkeit führt. Fertige trainierte Modelle sind für 123 Sprachen veröffentlicht worden. Zur Optimierung der Leistung werden Module angeboten, die OpenMP und SIMD-Befehle wie AVX2, AVX, AVX512F, NEON oder SSE4.1 verwenden.

Hauptverbesserungen:

  • Unterstützung für Rendering und Export im PAGE-XML-Format hinzugefügt.
  • Die Möglichkeit zur Modellschulung mit PNG-Dateien anstelle von LSTMF-Dateien wurde implementiert.
  • Das Rendering im PDF-Format wurde verbessert.
  • Die API zur Textneigungserkennung wurde erweitert.
  • Leistungsprobleme, die beim Scannen im Coverity-System festgestellt wurden, wurden behoben.

Quelle: opennet.ru

60GB SSD 8Gb DDR4