Wydanie systemu rozpoznawania tekstu Tesseract 5.5.0

Opublikowano wydanie systemu optycznego rozpoznawania tekstu Tesseract 5.5.0, który obsługuje Unicode oraz rozpoznawanie tekstów w ponad 100 językach, w tym rosyjskim, kazachskim, białoruskim i ukraińskim. Wynik może być zapisywany jako czysty tekst lub w formatach HTML (hOCR), ALTO (XML), PDF i TSV. System został pierwotnie stworzony w latach 1985-1995 w laboratoriach firmy Hewlett Packard, a w 2005 roku kod został udostępniony na licencji Apache i następnie rozwijany przy udziale pracowników firmy Google. Źródłowe kody projektu są dystrybuowane na licencji Apache 2.0.

Tesseract zawiera narzędzie konsolowe oraz bibliotekę libtesseract do integrowania funkcji rozpoznawania tekstu w innych aplikacjach. Wśród zewnętrznych interfejsów GUI obsługujących Tesseract można wymienić gImageReader, VietOCR i YAGF. Oferowane są dwa silniki rozpoznawania: klasyczny, rozpoznający tekst na poziomie wzorów pojedynczych znaków, oraz nowy, oparty na zastosowaniu systemu uczenia maszynowego z wykorzystaniem rekurencyjnej sieci neuronowej LSTM, zoptymalizowanej do rozpoznawania całych linii, co pozwala na znaczne zwiększenie dokładności. Gotowe wytrenowane modele są publikowane dla 123 języków. W celu optymalizacji wydajności oferowane są moduły wykorzystujące OpenMP oraz instrukcje SIMD AVX2, AVX, AVX512F, NEON lub SSE4.1.

Zaimplementowano wywołania systemowe waitid (oczekiwanie na zmianę stanu procesu), pinsyscall (do przekazywania informacji o punkcie wejścia execve w celu ochrony przed exploitami ROP), getthrname i setthrname (uzyskiwanie i ustalanie nazwy wątku).

  • Dodano wsparcie dla wektorowych rozszerzeń RISC-V V, na podstawie których przygotowano optymalizacje assemblerowe dla systemów z procesorami RISC-V.
  • Podczas zapisywania wyniku w formacie hOCR zapewniono ustawienie w tworzonym pliku parametrów ocrp_dir i ocrp_lang.
  • Zmodernizowano kod do określania dostępnych modeli językowych.
  • Ulepszono kod do generowania plików w formacie hOCR i usunięto konwersję nazw plików na platformie Windows.
  • Zezwolono na podawanie wartości symbolicznych w opcjach „—oem” i „—psm”.
  • W kodzie dokonano zamiany funkcji access i _access na metodę std::filesystem::exists(). Funkcje tprintf zostały zastąpione użyciem strumienia tesserr.
  • Usunięto wsparcie dla platformy uczenia maszynowego Tensorflow, która została wprowadzona, ale nigdy nie była wykorzystywana do realizacji modeli AI rozpoznawania.
  • Ulepszono instalator dla platformy Windows.
  • Submoduł googletest zaktualizowano do wersji 1.15.2.

Źródło: opennet.ru

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster