Dopo due anni di sviluppo, è stato rilasciato il sistema di riconoscimento del testo Ocrad 0.29 (Optical Character Recognition), sviluppato sotto l'egida del progetto GNU. Ocrad può essere utilizzato sia come libreria per integrare le funzioni OCR in altre applicazioni, sia come utilità autonoma, che fornisce il testo in UTF-8 o codifiche a 8 bit in base all'immagine fornita in input.
Per il riconoscimento ottico, Ocrad utilizza un metodo di estrazione delle caratteristiche. Comprende un analizzatore del layout della pagina, che consente di separare correttamente colonne e blocchi di testo in documenti stampati. Il riconoscimento è supportato solo per i caratteri delle codifiche 'ascii', 'iso-8859-9' e 'iso-8859-15' (non è supportato il cirillico).
Nella nuova versione:
- Migliorato il riconoscimento della forma della lettera «L» con la parte destra inclinata.
- Utilizzando l'opzione ‘-o’ (‘—output’), è garantita la creazione delle directory intermedie mancanti specificate nel percorso del file.
- Nel file di configurazione e in Makefile.in è stata aggiunta la variabile MAKEINFO.
- I messaggi diagnostici relativi alle operazioni sui file sono stati trasformati nella forma ‘PROGRAM: FILE: MESSAGE’.
- Nei messaggi sull'uso di argomenti non corretti della riga di comando, è stata garantita la presenza dell'argomento e del nome dell'opzione.
Fonte: opennet.ru
