Veröffentlichung des Texterkennungssystems Tesseract 5.5.0

Die Veröffentlichung des Systems zur optischen Texterkennung Tesseract 5.5.0 wurde bekannt gegeben. Es unterstützt Unicode und die Erkennung von Texten in mehr als 100 Sprachen, darunter Russisch, Kasachisch, Weißrussisch und Ukrainisch. Die Ergebnisse können sowohl im offenen Textformat als auch in den Formaten HTML (hOCR), ALTO (XML), PDF und TSV gespeichert werden. Ursprünglich wurde das System in den Jahren 1985-1995 im Labor von Hewlett Packard entwickelt, im Jahr 2005 wurde der Code unter der Apache-Lizenz freigegeben und anschließend mit der Beteiligung von Mitarbeitern von Google weiterentwickelt. Die Quelltexte des Projekts werden unter der Lizenz Apache 2.0 verbreitet.

Tesseract umfasst eine Konsolenanwendung und die Bibliothek libtesseract, um Funktionen zur Texterkennung in andere Anwendungen zu integrieren. Unter den unterstützenden GUI-Schnittstellen für Tesseract sind gImageReader, VietOCR und YAGF zu erwähnen. Es werden zwei Erkennungs-Engines angeboten: eine klassische, die Text auf Basis von Vorlagen einzelner Zeichen erkennt, und eine neue, die auf dem Einsatz eines maschinellen Lernsystems auf Basis eines rekurrenten neuronalen Netzwerks (LSTM) basiert. Diese ist für die Erkennung kompletter Zeilen optimiert und ermöglicht eine erhebliche Steigerung der Genauigkeit. Fertig trainierte Modelle sind für 123 Sprachen veröffentlicht.

Hauptverbesserungen:

  • Die Unterstützung von Vektor-Erweiterungen RISC-V V wurde hinzugefügt, auf deren Grundlage Assembler-Optimierungen für Systeme mit RISC-V-Prozessoren vorbereitet wurden.
  • Beim Speichern des Ergebnisses im hOCR-Format werden die Parameter ocrp_dir und ocrp_lang in der erstellten Datei gesetzt.
  • Der Code zur Bestimmung verfügbarer Sprachmodelle wurde modernisiert.
  • Der Code zur Erstellung von Dateien im hOCR-Format wurde verbessert, und die Umwandlung von Dateinamen auf der Windows-Plattform wurde entfernt.
  • Das Angeben von symbolischen Werten in den Optionen "—oem" und "—psm" wurde erlaubt.
  • Im Code wurden die Funktionen access und _access durch die Methode std::filesystem::exists() ersetzt. Die Funktionen tprintf wurden durch die Verwendung des Streams tesserr ersetzt.
  • Die Unterstützung der Machine-Learning-Plattform Tensorflow wurde entfernt, die ursprünglich implementiert wurde, aber nie zur Ausführung von AI-Modellen zur Texterkennung verwendet wurde.
  • Der Installer für die Windows-Plattform wurde verbessert.
  • Das Submodul googletest wurde auf Version 1.15.2 aktualisiert.

Quelle: opennet.ru

60GB SSD 8Gb DDR4