Se ha publicado la versión del sistema de reconocimiento óptico de caracteres Tesseract 5.1, que admite el reconocimiento de caracteres UTF-8 y textos en más de 100 idiomas, incluidos el ruso, kazajo, bielorruso y ucraniano. El resultado se puede guardar como texto plano o en formatos HTML (hOCR), ALTO (XML), PDF y TSV. Inicialmente, el sistema fue creado entre 1985 y 1995 en el laboratorio de la empresa Hewlett Packard, en 2005 el código fue liberado bajo la licencia Apache y desde entonces ha sido desarrollado con la participación de empleados de Google. Los textos fuente del proyecto se distribuyen bajo la licencia Apache 2.0.
Tesseract incluye una utilidad de consola y la biblioteca libtesseract para integrar funciones de reconocimiento de texto en otras aplicaciones. Entre las interfaces GUI de terceros que soportan Tesseract, se pueden destacar gImageReader, VietOCR y YAGF. Se ofrecen dos motores de reconocimiento: el clásico, que reconoce texto a nivel de plantillas de caracteres individuales, y uno nuevo, basado en un sistema de aprendizaje automático con una red neuronal recurrente LSTM, optimizado para el reconocimiento de líneas completas y que permite un aumento significativo de la precisión. Se han publicado modelos entrenados para 123 idiomas. Para optimizar el rendimiento, se ofrecen módulos que utilizan OpenMP y las instrucciones SIMD AVX2, AVX, NEON o SSE4.1.
Principales mejoras en Tesseract 5.1:
- Se ha implementado la capacidad de procesar áreas con imágenes y líneas al exportar en formatos ALTO, hOCR y texto.
- Se ha añadido un nuevo parámetro curl_timeout usando curl_easy_setop.
- Se ha mejorado el sistema de compilación.
- Se ha trabajado en la eliminación de código no utilizado.
- Se han corregido fallos causados por el manejo incorrecto de punteros nulos en la clase PageIterator::Orientation.
Fuente: opennet.ru
