Después de dos años de desarrollo, se ha formado la versión del sistema de reconocimiento de texto Ocrad 0.29 (Reconocimiento Óptico de Caracteres), desarrollado bajo la égida del proyecto GNU. Ocrad puede usarse tanto en forma de biblioteca para integrar funciones OCR en otras aplicaciones, como en forma de utilidad independiente, que a partir de una imagen proporcionada genera texto en UTF-8 o en codificaciones de 8 bits.
Para el reconocimiento óptico en Ocrad se utiliza el método de extracción de características (feature extraction). Incluye un analizador de diseño de página que permite separar correctamente columnas y bloques de texto en documentos impresos. El reconocimiento solo se admite para caracteres de las codificaciones 'ascii', 'iso-8859-9' y 'iso-8859-15' (no hay soporte para el cirílico).
En la nueva versión:
- Se ha mejorado el reconocimiento del trazo de la letra "L" con la parte derecha inclinada.
- Al utilizar la opción ‘-o’ (‘—output’), se garantiza la creación de los directorios intermedios que faltan, indicados en la ruta del archivo especificado.
- Se ha añadido la variable MAKEINFO al archivo de configuración y a Makefile.in.
- Los mensajes de diagnóstico relacionados con las operaciones de archivos se han transformado en la forma ‘PROGRAMA: ARCHIVO: MENSAJE’.
- En los mensajes sobre el uso de argumentos de línea de comandos incorrectos, se ha proporcionado el argumento y el nombre de la opción.
Fuente: opennet.ru
