Se ha publicado la versión del sistema de reconocimiento óptico de caracteres Tesseract 5.4.0, que soporta el reconocimiento de caracteres UTF-8 y textos en más de 100 idiomas, incluyendo ruso, kazajo, bielorruso y ucraniano. Los resultados pueden guardarse como texto plano, así como en formatos HTML (hOCR), ALTO (XML), PDF y TSV. Originalmente, el sistema fue creado entre 1985 y 1995 en el laboratorio de la compañía Hewlett Packard, en 2005, el código fue liberado bajo la licencia Apache y posteriormente se desarrolló con la participación de empleados de Google. Los textos fuente del proyecto se distribuyen bajo la licencia Apache 2.0.
Tesseract incluye una utilidad de consola y la biblioteca libtesseract para integrar funciones de reconocimiento de texto en otras aplicaciones. Entre las GUI de terceros que soportan Tesseract se encuentran gImageReader, VietOCR y YAGF. Se ofrecen dos motores de reconocimiento: el clásico, que reconoce el texto a nivel de patrones de caracteres individuales, y uno nuevo, basado en un sistema de aprendizaje automático con red neuronal recurrente LSTM, optimizado para el reconocimiento de líneas completas y que permite lograr un aumento significativo en la precisión. Se publican modelos entrenados listos para 123 idiomas. Para optimizar el rendimiento, se ofrecen módulos que utilizan instrucciones OpenMP y SIMD AVX2, AVX, AVX512F, NEON o SSE4.1.
Principales mejoras:
- Se ha añadido soporte para renderizar y exportar en formato PAGE-XML.
- Se ha implementado la posibilidad de entrenar el modelo utilizando archivos en formato PNG en lugar de archivos LSTMF.
- Se ha mejorado el renderizado en formato PDF.
- Se ha ampliado la API para la detección de inclinación de texto.
- Se han resuelto problemas de rendimiento detectados al escanear en el sistema Coverity.
Fuente: opennet.ru
