Sortie du système de reconnaissance de texte Tesseract 5.5.0
La version du système de reconnaissance optique de caractères Tesseract 5.5.0 a été publiée, prenant en charge Unicode et la reconnaissance de textes en plus de 100 langues, y compris le russe, le kazakh, le biélorusse et l'ukrainien. Le résultat peut être enregistré tant en texte brut qu'en formats HTML (hOCR), ALTO (XML), PDF et TSV. Le système a été initialement développé entre 1985 et 1995 dans le laboratoire de la compagnie Hewlett Packard, en 2005 […]
