Veröffentlichung des Texterkennungssystems Tesseract 5.5.0
Die Version des Systems zur optischen Texterkennung Tesseract 5.5.0 wurde veröffentlicht, die Unicode unterstützt und Texte in mehr als 100 Sprachen erkennt, darunter Russisch, Kasachisch, Belarussisch und Ukrainisch. Das Ergebnis kann sowohl als Klartext als auch in den Formaten HTML (hOCR), ALTO (XML), PDF und TSV gespeichert werden. Das System wurde ursprünglich in den Jahren 1985-1995 im Labor der Firma Hewlett Packard entwickelt, 2005 […]
