Opublikowano wersję systemu optycznego rozpoznawania tekstu Tesseract 5.4.0, który zapewnia rozpoznawanie znaków UTF-8 i tekstów w ponad 100 językach, w tym rosyjskim, kazachskim, białoruskim i ukraińskim. Wyniki można zapisywać zarówno jako zwykły tekst, jak i w formatach HTML (hOCR), ALTO (XML), PDF i TSV. System został pierwotnie stworzony w latach 1985-1995 w laboratorium firmy Hewlett Packard, a w 2005 roku kod został udostępniony na licencji Apache i od tego czasu rozwijany z udziałem pracowników firmy Google. Źródłowe teksty projektu są rozpowszechniane na licencji Apache 2.0.
Tesseract zawiera konsolową aplikację oraz bibliotekę libtesseract do wbudowywania funkcji rozpoznawania tekstu w inne aplikacje. Z wymienionych zewnętrznych interfejsów GUI wspierających Tesseract warto wymienić gImageReader, VietOCR i YAGF. Oferowane są dwa silniki rozpoznawania: klasyczny, rozpoznający tekst na poziomie wzorów poszczególnych znaków, oraz nowy, oparty na zastosowaniu systemu uczenia maszynowego na bazie rekurencyjnej sieci neuronowej LSTM, zoptymalizowanej do rozpoznawania całych linii i pozwalającej na znaczne zwiększenie dokładności. Gotowe wytrenowane modele opublikowano dla 123 języków. Aby zoptymalizować wydajność, dostępne są moduły wykorzystujące OpenMP oraz instrukcje SIMD AVX2, AVX, AVX512F, NEON lub SSE4.1.
Zaimplementowano wywołania systemowe waitid (oczekiwanie na zmianę stanu procesu), pinsyscall (do przekazywania informacji o punkcie wejścia execve w celu ochrony przed exploitami ROP), getthrname i setthrname (uzyskiwanie i ustalanie nazwy wątku).
- Dodano wsparcie dla renderowania i eksportu w formacie PAGE-XML.
- Wprowadzono możliwość trenowania modelu przy użyciu plików w formacie PNG zamiast plików LSTMF.
- Ulepszono renderowanie w formacie PDF.
- Rozszerzono API do określania nachylenia tekstu.
- Usunięto problemy z wydajnością zidentyfikowane podczas skanowania w systemie Coverity.
Źródło: opennet.ru
