Se ha publicado la versión del sistema de reconocimiento óptico de caracteres Tesseract 5.2, que soporta el reconocimiento de caracteres UTF-8 y textos en más de 100 idiomas, incluidos ruso, kazajo, bielorruso y ucraniano. Los resultados se pueden guardar como texto plano o en formatos HTML (hOCR), ALTO (XML), PDF y TSV. El sistema fue creado inicialmente entre 1985 y 1995 en el laboratorio de la compañía Hewlett Packard, el código fue abierto bajo licencia Apache en 2005 y ha sido desarrollado posteriormente con la participación de empleados de Google. Los textos originales del proyecto se distribuyen bajo la licencia Apache 2.0.
Tesseract incluye una utilidad de consola y la biblioteca libtesseract para integrar funciones de reconocimiento de texto en otras aplicaciones. Entre las GUI de terceros que soportan Tesseract se encuentran gImageReader, VietOCR y YAGF. Se ofrecen dos motores de reconocimiento: el clásico, que reconoce el texto a nivel de patrones de caracteres individuales, y uno nuevo, basado en un sistema de aprendizaje automático con red neuronal recurrente LSTM, optimizado para el reconocimiento de líneas completas y que permite lograr un aumento significativo en la precisión. Se publican modelos entrenados listos para 123 idiomas. Para optimizar el rendimiento, se ofrecen módulos que utilizan instrucciones OpenMP y SIMD AVX2, AVX, AVX512F, NEON o SSE4.1.
Principales mejoras en Tesseract 5.2:
- Se han añadido optimizaciones implementadas utilizando instrucciones Intel AVX512F.
- Se ha implementado en la API de C una función para inicializar tesseract cargando la modelo de aprendizaje automático desde la memoria.
- Se ha añadido el parámetro invert_threshold, que define el nivel de inversión de las líneas de texto. Por defecto, se establece en 0.7. Para desactivar la inversión, se debe establecer el valor en 0.
- Se ha mejorado el procesamiento de documentos muy grandes en hosts de 32 bits.
- Se ha realizado la transición del uso de funciones std::regex a std::string.
- Se han mejorado los scripts de compilación para Autotools, CMake y sistemas de integración continua.
Fuente: opennet.ru
