Release des Texterkennungssystems Tesseract 5.4.0
Die Veröffentlichung der Text-Optischen-Erkennungssoftware Tesseract 5.4.0 unterstützt die Erkennung von UTF-8-Zeichen und Texten in mehr als 100 Sprachen, einschließlich Russisch, Kasachisch, Weißrussisch und Ukrainisch. Die Ergebnisse können sowohl im offenen Text- als auch in den Formaten HTML (hOCR), ALTO (XML), PDF und TSV gespeichert werden. Ursprünglich wurde das System in den Jahren 1985-1995 im Labor des Unternehmens Hewlett Packard entwickelt, in […]
