Projekt entwickelt ein neues System zur optischen Texterkennung, das über 40 Sprachen unterstützt, darunter Englisch, Deutsch, Französisch, Japanisch, Chinesisch, Koreanisch, Usbekisch, Aserbaidschanisch und Litauisch. Sprachen, die auf dem Kyrillischen basieren, werden vorerst nicht unterstützt, aber ihre Integration ist geplant. Der Code ist in Python unter Verwendung des Frameworks geschrieben und unter der Lizenz Apache 2.0. Zum Download fertige Modelle für Sprachen auf Basis des lateinischen Alphabets und von Schriftzeichen.
Zur Erkennung und Texterkennung auf Bildern werden Methoden des maschinellen Lernens angewendet. Zur Texterkennung wird der maschinelle Lernalgorithmus (Character-Region Awareness For Text) in für PyTorch verwendet, der in der Lage ist, Text auf beliebigen Objekten zu extrahieren, einschließlich Etiketten, Informationsschildern und Verkehrsschildern. Für die Erkennung von Zeichenfolgen wird ein konvolutionales rekurrentes neuronales Netzwerk (Convolutional Recurrent Neural Network, eine Kombination aus DCNN und RNN) sowie der CTC BeamSearch (Connectionist Temporal Classification) zum Decodieren der Ausgabedaten des neuronalen Netzwerks in ein Textformat eingesetzt.
Quelle: opennet.ru
