Wydanie systemu rozpoznawania tekstu GNU Ocrad 0.29

Po dwóch latach prac stworzono wydanie systemu rozpoznawania tekstu Ocrad 0.29 (Optical Character Recognition), rozwijanego pod auspicjami projektu GNU. Ocrad może być używany zarówno jako biblioteka do integracji funkcji OCR w innych aplikacjach, jak i jako samodzielne narzędzie, które na podstawie przesłanego obrazu zamienia go na tekst w UTF-8 lub w 8-bitowych kodowaniach.

Do optycznego rozpoznawania w Ocrad zastosowano metodę ekstrakcji cech (feature extraction). W skład systemu wchodzi analizator układu strony, umożliwiający poprawne oddzielanie kolumn i bloków tekstu w dokumentach drukowanych. Rozpoznawanie jest wspierane tylko dla znaków z kodowań „ascii”, „iso-8859-9” i „iso-8859-15” (brak wsparcia dla cyrylicy).

W nowej wersji:

  • Ulepszono rozpoznawanie pisma litery „L” z ukośną prawą częścią.
  • Przy użyciu opcji ‘-o’ (‘—output’) zapewniono utworzenie brakujących katalogów pośrednich wskazanych w podanej ścieżce do pliku.
  • Do pliku konfiguracyjnego configure oraz Makefile.in dodano zmienną MAKEINFO.
  • Komunikaty diagnostyczne związane z operacjami na plikach przekształcono do formy ‘PROGRAM: FILE: MESSAGE’.
  • W komunikatach dotyczących użycia niepoprawnych argumentów wiersza poleceń zapewniono wskazanie argumentu i nazwy opcji.

Źródło: opennet.ru

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster