Nach drei Jahren seit dem letzten Release wurde die Version 0.28 des Text-Erkennungssystems Ocrad (Optical Character Recognition) veröffentlicht, das unter dem Dach des GNU-Projekts entwickelt wird. Ocrad kann sowohl als Bibliothek zur Integration von OCR-Funktionen in andere Anwendungen als auch als eigenstĂ€ndiges Dienstprogramm verwendet werden, das auf Basis des ĂŒbergebenen Bildes Text in UTF-8 oder 8-Bit-Codierungen ausgibt.
FĂŒr die optische Erkennung nutzt Ocrad das Verfahren der Merkmalsauswahl (feature extraction). Bestandteil ist ein Layout-Analyse-Tool, das es ermöglicht, Spalten und Textblöcke in gedruckten Dokumenten korrekt zu trennen. Die Erkennung wird nur fĂŒr Zeichen aus den Codierungen âasciiâ, âiso-8859-9â und âiso-8859-15â unterstĂŒtzt (UnterstĂŒtzung fĂŒr Kyrillisch fehlt).
Es wird darauf hingewiesen, dass in die neue Version eine groĂe Anzahl kleiner Fehlerbehebungen und Verbesserungen einfloss. Die bedeutendste Ănderung war die UnterstĂŒtzung des PNG-Bildformats, die mit Hilfe der Bibliothek libpng umgesetzt wurde, was die Arbeit mit dem Programm erheblich erleichterte, da zuvor nur Bilder in PNM-Formaten verarbeitet werden konnten.
Quelle: opennet.ru
