lëshimi i sistemit të njohjes optike të tekstit , mbështet njohjen e simboleve UTF-8 dhe teksteve në më shumë se 100 gjuhë, duke përfshirë rusishten, kazakishten, bjellorusishten dhe ukrainishten. Rezultati mund të ruhet si tekst i hapur, ashtu edhe në formatet HTML (hOCR), ALTO (XML), PDF dhe TSV. Fillimisht, sistemi u krijua në vitet 1985-1995 në laboratorin e kompanisë Hewlett Packard, në vitin 2005 kodi u hap nën licencën Apache dhe më vonë u zhvillua me pjesëmarrjen e punonjësve të kompanisë Google. Tekstet burimore të projektit nën licencën Apache 2.0.
Tesseract përfshin një utilitar konsolë dhe bibliotekën libtesseract për integrimin e funksioneve të njohjes së tekstit në aplikacione të tjera. Nga mbështetësit e Tesseract të tretë about:support , dhe . Dy motorë njohës ofrohen: ai klasik, që njeh tekstin në nivelin e modele të simboleve të veçanta, dhe ai i ri, i bazuar në aplikimin e sistemit të mësimit makine duke përdorur një rrjet të neuralit LSTM, i optimizuar për njohjen e rreshtave të tërë dhe që lejon një rritje të konsiderueshme të saktësisë. Modelet e trajnuara tashmë janë publikuar për . Për optimizimin e performancës ofrohen module që përdorin OpenMP dhe instrukcionet SIMD AVX2, AVX ose SSE4.1.
Main në Tesseract 4.1:
- Shtuar mundësia e daljes në formatin XML (Analizimi i Skemës dhe Objekti i Tekstit). Për të përdorur këtë format, duhet të nisni aplikacionin si «tesseract emri_i_imazhit katalogu_i_daljes alto»;
- Shtuar module të reja renderimi LSTMBox dhe WordStrBox, që lehtësojnë trajnimet e motorit;
- Shtuar mbështetje për grafikën pseudografike në daljen hOCR (HTML);
- Shtuar skript alternativa të shkruara në gjuhën Python për trajnimin e motorit mbi bazën e mësimit makine;
- Zgjeruar optimizimet duke përdorur instrukcionet AVX, AVX2 dhe SSE;
- Përdefault, mbështetja për OpenMP është çaktivizuar për shkak të performancës;
- Në motorin LSTM është shtuar mbështetje për lista të bardha dhe të zeza;
- Skenarët e ndërtimit të përmirësuar duke përdorur Cmake.
Burimi: opennet.ru
