Freigabe des Textverarbeitungssystems Tesseract 4.1
Die Freigabe des optischen Texterkennungssystems Tesseract 4.1 wurde vorbereitet, das die Erkennung von UTF-8-Zeichen und Texten in über 100 Sprachen, darunter Russisch, Kasachisch, Weißrussisch und Ukrainisch, unterstützt. Die Ergebnisse können sowohl als Klartext als auch in den Formaten HTML (hOCR), ALTO (XML), PDF und TSV gespeichert werden. Das System wurde ursprünglich in den Jahren 1985-1995 im Labor von Hewlett Packard entwickelt, in […]
