Release of the text recognition system Tesseract 4.1
The release of the Tesseract 4.1 optical character recognition system has been prepared, supporting UTF-8 character recognition and texts in over 100 languages, including Russian, Kazakh, Belarusian, and Ukrainian. The results can be saved as plain text or in formats such as HTML (hOCR), ALTO (XML), PDF, and TSV. The system was originally created between 1985-1995 in a laboratory at Hewlett Packard, in […]
