Lanzamiento del sistema de reconocimiento de texto Tesseract 4.1
Se ha preparado el lanzamiento del sistema de reconocimiento óptico de caracteres Tesseract 4.1, que soporta el reconocimiento de caracteres UTF-8 y textos en más de 100 idiomas, incluidos el ruso, kazajo, bielorruso y ucraniano. El resultado puede ser guardado tanto como texto plano, así como en formatos HTML (hOCR), ALTO (XML), PDF y TSV. Originalmente, el sistema fue creado entre 1985 y 1995 en el laboratorio de la empresa Hewlett Packard, en […]
