Po dwóch latach prac stworzono wydanie systemu rozpoznawania tekstu Ocrad 0.29 (Optical Character Recognition), rozwijanego pod auspicjami projektu GNU. Ocrad może być używany zarówno jako biblioteka do integracji funkcji OCR w innych aplikacjach, jak i jako samodzielne narzędzie, które na podstawie przesłanego obrazu zamienia go na tekst w UTF-8 lub w 8-bitowych kodowaniach.
Do optycznego rozpoznawania w Ocrad zastosowano metodę ekstrakcji cech (feature extraction). W skład systemu wchodzi analizator układu strony, umożliwiający poprawne oddzielanie kolumn i bloków tekstu w dokumentach drukowanych. Rozpoznawanie jest wspierane tylko dla znaków z kodowań „ascii”, „iso-8859-9” i „iso-8859-15” (brak wsparcia dla cyrylicy).
W nowej wersji:
- Ulepszono rozpoznawanie pisma litery „L” z ukośną prawą częścią.
- Przy użyciu opcji ‘-o’ (‘—output’) zapewniono utworzenie brakujących katalogów pośrednich wskazanych w podanej ścieżce do pliku.
- Do pliku konfiguracyjnego configure oraz Makefile.in dodano zmienną MAKEINFO.
- Komunikaty diagnostyczne związane z operacjami na plikach przekształcono do formy ‘PROGRAM: FILE: MESSAGE’.
- W komunikatach dotyczących użycia niepoprawnych argumentów wiersza poleceń zapewniono wskazanie argumentu i nazwy opcji.
Źródło: opennet.ru
