lanzamiento del sistema de reconocimiento óptico de texto , que soporta el reconocimiento de caracteres UTF-8 y textos en más de 100 idiomas, incluyendo ruso, kazajo, bielorruso y ucraniano. El resultado puede guardarse como texto plano o en formatos HTML (hOCR), ALTO (XML), PDF y TSV. Inicialmente, el sistema fue creado entre 1985 y 1995 en el laboratorio de la compañía Hewlett Packard, en 2005 el código fue liberado bajo la licencia Apache y luego se desarrolló con la participación de empleados de Google. Los textos originales del proyecto bajo la licencia Apache 2.0.
Tesseract incluye una utilidad de consola y la biblioteca libtesseract para integrar funciones de reconocimiento de texto en otras aplicaciones. Entre las interfaces GUI de terceros que soportan Tesseract gImageReader , y 123 idiomas en Tesseract 4.1:
Principales Se ha añadido la opción de salida en formato XML
- ALTO Se han añadido nuevos módulos de renderizado LSTMBox y WordStrBox, facilitando el entrenamiento del motor;
- Se ha añadido soporte para gráficos ASCII en la salida hOCR (HTML);
- Se han añadido scripts alternativos en Python para entrenar el motor basado en aprendizaje automático;
- Se han ampliado las optimizaciones utilizando instrucciones AVX, AVX2 y SSE;
- Por defecto, el soporte de OpenMP está deshabilitado debido a
- rendimiento; En el motor LSTM se ha añadido soporte para listas blancas y negras;
- Se han mejorado los scripts de compilación basados en Cmake.
- Se ha preparado el lanzamiento del sistema de reconocimiento óptico de texto
Fuente: opennet.ru
