Opublikowano wersję systemu optycznego rozpoznawania tekstu Tesseract 5.1, która obsługuje rozpoznawanie znaków UTF-8 oraz tekstów w ponad 100 językach, w tym rosyjskim, kazachskim, białoruskim i ukraińskim. Wynik może być zapisywany zarówno jako tekst zwykły, jak i w formatach HTML (hOCR), ALTO (XML), PDF i TSV. System został początkowo stworzony w latach 1985-1995 w laboratoriach firmy Hewlett Packard, a w 2005 roku kod został udostępniony na licencji Apache i dalej rozwijany przy udziale pracowników firmy Google. Źródłowe teksty projektu są rozpowszechniane na licencji Apache 2.0.
Tesseract zawiera konsolowe narzędzie oraz bibliotekę libtesseract do wbudowywania funkcji rozpoznawania tekstu w inne aplikacje. Do obsługujących Tesseract zewnętrznych interfejsów GUI można zaliczyć gImageReader, VietOCR oraz YAGF. Oferowane są dwa silniki rozpoznawania: klasyczny, rozpoznający tekst na poziomie wzorców poszczególnych znaków, oraz nowy, oparty na zastosowaniu systemu uczenia maszynowego opartego na rekurencyjnej sieci neuronowej LSTM, zoptymalizowanej do rozpoznawania całych linii tekstu, co pozwala osiągnąć znaczny wzrost dokładności. Gotowe wytrénowane modele zostały opublikowane dla 123 języków. W celu optymalizacji wydajności oferowane są moduły wykorzystujące OpenMP oraz instrukcje SIMD AVX2, AVX, NEON lub SSE4.1.
Główne ulepszenia w Tesseract 5.1:
- Zrealizowano możliwość przetwarzania obszarów z obrazami i liniami przy wyjściu w formatach ALTO, hOCR i text.
- Dodano nowy parametr curl_timeout do curl_easy_setop.
- Ulepszono system budowy.
- Przeprowadzono prace nad usunięciem nieużywanego kodu.
- Usunięto awarie spowodowane niewłaściwym przetwarzaniem wskaźników zerowych w klasie PageIterator::Orientation.
Źródło: opennet.ru
