Después de tres años desde el último lanzamiento, se ha formado la versión 0.28 del sistema de reconocimiento de texto Ocrad (Reconocimiento Óptico de Caracteres), desarrollado bajo el auspicio del proyecto GNU. Ocrad se puede utilizar tanto en forma de biblioteca para integrar funciones OCR en otras aplicaciones, como en forma de una utilidad independiente que, a partir de una imagen proporcionada, produce texto en UTF-8 o codificaciones de 8 bits.
Para el reconocimiento óptico en Ocrad se utiliza el método de extracción de características (feature extraction). Incluye un analizador de diseño de página que permite separar correctamente columnas y bloques de texto en documentos impresos. El reconocimiento solo se admite para caracteres de las codificaciones 'ascii', 'iso-8859-9' y 'iso-8859-15' (no hay soporte para el cirílico).
Se observa que la nueva versión incluye una gran cantidad de pequeñas correcciones y mejoras. El cambio más significativo fue la adición del soporte para el formato de imágenes PNG, implementado mediante la biblioteca libpng, lo que facilitó enormemente el trabajo con el programa, ya que anteriormente solo se podían proporcionar imágenes en formatos PNM.
Fuente: opennet.ru
