
Forscher von Microsoft haben ein KI-System entwickelt, das in der Lage ist, Bildbeschreibungen zu generieren, die in vielen FĂ€llen prĂ€ziser sind als von Menschen erstellte. Dieser Durchbruch stellt einen wichtigen Meilenstein im Bestreben von Microsoft dar, seine Produkte und Dienstleistungen inklusiv und fĂŒr alle Nutzer zugĂ€nglich zu machen.
âBildbeschreibungen sind eine der Hauptfunktionen des maschinellen Sehens, die die Arbeit einer Vielzahl von Diensten ermöglichenâ, sagte Xuedong Huang (), technischer Mitarbeiter von Microsoft und Chief Technical Officer fĂŒr Azure AI Cognitive Services in Redmond (Washington).
Das neue Modell ist nun ĂŒber Computer Vision in , das Teil von Azure AI ist, fĂŒr Entwickler zugĂ€nglich und ermöglicht die Verbesserung der Barrierefreiheit ihrer Dienste. Es wird auch in die App Seeing AI integriert und wird Ende dieses Jahres in Microsoft Word und Outlook fĂŒr Windows und Mac sowie in PowerPoint fĂŒr Windows, Mac und in der Webversion verfĂŒgbar sein.
Die automatische Beschreibung hilft Nutzern, auf wichtige Inhalte von Bildern zuzugreifen, sei es ein Foto, das in den Suchergebnissen angezeigt wird, oder eine Illustration fĂŒr eine PrĂ€sentation.
âDie Verwendung von Bildunterschriften, die den Inhalt der Bilder beschreiben (der sogenannte alternative oder Ersatztext), auf Webseiten und in Dokumenten ist besonders wichtig fĂŒr blinde oder sehbehinderte Menschenâ, bemerkte Saqib Shaikh (), Software-Manager in der AI-Plattform-Gruppe von Microsoft in Redmond.
Sein Team nutzt beispielsweise die verbesserte Funktion zur Bildbeschreibung in der Anwendung fĂŒr blinde und sehbehinderte Menschen , die erkennt, was die Kamera aufnimmt, und darĂŒber berichtet. Die Anwendung verwendet generierte Bildunterschriften, um Fotos, einschlieĂlich solcher aus sozialen Medien, zu beschreiben.
Idealerweise sollten alle alternativen Texte fĂŒr Bilder in Dokumenten, im Internet und in sozialen Medien hinzugefĂŒgt werden, da dies blinden Menschen den Zugang zu Inhalten und die Teilnahme am GesprĂ€ch ermöglicht. Leider tun dies jedoch die Menschen nicht, sagt Sheikh. Es gibt jedoch mehrere Anwendungen, die die Funktion zur Bildbeschreibung nutzen, um alternativen Text hinzuzufĂŒgen, wenn dieser fehlt.
 Â

Lijuan Wang, Hauptmanagerin fĂŒr Forschung im Microsoft-Labor in Redmond, leitete ein Forschungsteam, das Ergebnisse erzielte, die mit menschlichen Leistungen vergleichbar sind und diese ĂŒbertrafen. Foto: Dan DeLong.
Beschreibung neuer Objekte
âDie Beschreibung von Bildern ist eine der Hauptaufgaben der Computer Vision, die ein KI-System erfordert, um den grundlegenden Inhalt oder die Handlung, die im Bild dargestellt ist, zu verstehen und zu beschreibenâ, erklĂ€rte Lijuan Wang (), Hauptmanagerin fĂŒr Forschung im Microsoft-Labor in Redmond.
âEs ist wichtig zu verstehen, was passiert, die Beziehungen zwischen Objekten und Aktionen herauszufinden und dann alles in einem fĂŒr den Menschen verstĂ€ndlichen Satz zusammenzufassenâ, sagte sie.
Wang leitete eine Forschungsgruppe, die bei der Benchmarks fĂŒr das  (novel object captioning at scale) Ergebnisse erzielte, die mit menschlichen Resultaten vergleichbar sind und diese sogar ĂŒbertreffen. Diese Tests bewerten, wie gut KI-Systeme Beschreibungen von abgebildeten Objekten generieren, die nicht im Datensatz enthalten sind, auf dem das Modell trainiert wurde.
Typischerweise werden Bildbeschreibungs-Systeme auf DatensÀtzen trainiert, die Bilder mit begleitenden Textbeschreibungen enthalten, also auf beschrifteten BilddatensÀtzen.
âDer nocaps-Test zeigt, wie gut das System in der Lage ist, neue Objekte zu beschreiben, die in den Trainingsdaten nicht vorkommenâ, sagt Wang.
Um diese Aufgabe zu lösen, hat das Microsoft-Team ein groĂes KI-Modell auf einem umfangreichen Datensatz mit Bildern und Textbeschriftungen vortrainiert, wobei jede Beschriftung mit einem bestimmten Objekt im Bild verknĂŒpft wurde.
DatensĂ€tze mit Bildbeschriftungen anstelle vollstĂ€ndiger Beschreibungen sind effizienter zu erstellen, was dem Team von Wang ermöglichte, viele Daten in ihr Modell einzufĂŒhren. Durch diesen Ansatz erhielt das Modell, was das Team als visuellen Wortschatz bezeichnet.
Wie Juan erklÀrte, Àhnelt der Ansatz des Vortrainings mit einem visuellen Wortschatz der Vorbereitung von Kindern auf das Lesen: ZunÀchst wird ein Bilderbuch verwendet, in dem einzelne Wörter mit Bildern assoziiert werden, beispielsweise steht unter einem Foto eines Apfels 'Apfel', und unter einem Foto einer Katze steht das Wort 'Katze'.
âDiese Art der Vorbereitung mit einem visuellen Wortschatz ist im Grunde die Grundbildung, die notwendig ist, um das System zu schulen. So versuchen wir, eine Art motorisches GedĂ€chtnis aufzubauenâ, sagte Juan.
Das vortrainierte Modell wird anschlieĂend mit einem Datensatz verfeinert, der signierte Bilder umfasst. In dieser Trainingsphase lernt das Modell, SĂ€tze zu formulieren. Wenn ein Bild mit neuen Objekten erscheint, nutzt das KI-System ein visuelles Lexikon, um prĂ€zise Beschreibungen zu erstellen.
âUm mit neuen Objekten bei Tests umzugehen, kombiniert das System, was es wĂ€hrend des Vortrainings und der nachfolgenden Verfeinerung gelernt hatâ, sagt Wang.
Laut den Ergebnissen , schnitt das KI-System in nocaps-Tests besser ab und erstellte bedeutungsvollere und genauere Beschreibungen als Menschen fĂŒr dieselben Bilder.
Beschleunigter Ăbergang in die ArbeitsumgebungÂ
Ăberdies ist das neue Bildbeschreibungsystem doppelt so gut wie das Modell, das seit 2015 in Microsoft-Produkten und -Diensten verwendet wird, basierend auf einem Vergleich mit einem anderen Branchenstandard.
Angesichts der Vorteile, die alle Nutzer von Microsoft-Produkten und -Diensten durch diese Verbesserung erhalten werden, hat Juan die Integration des neuen Modells in die Arbeitsumgebung von Azure beschleunigt.
âWir nutzen diese bahnbrechende KI-Technologie auf Azure als Plattform, um eine breitere Kundenbasis zu bedienenâ, sagte er. âUnd dieser Durchbruch ist nicht nur in der Forschung bemerkenswert. Die Zeit, die benötigt wurde, um diesen Durchbruch in die Azure-Umgebung zu integrieren, war ebenfalls revolutionĂ€r.â
Juan fĂŒgte hinzu, dass die Erzielung von Ergebnissen, die mit menschlichen Leistungen vergleichbar sind, den bereits etablierten Trend in Microsofts kognitiven Intelligenzsystemen fortsetzt.
âIn den letzten fĂŒnf Jahren haben wir in fĂŒnf wichtigen Bereichen Ergebnisse erreicht, die mit menschlichen FĂ€higkeiten vergleichbar sind: in der SprachÂerkennung, maschinellen Ăbersetzung, Beantwortung von Fragen, maschinellem Lesen und TextverstĂ€ndnis. Und im Jahr 2020, trotz COVID-19, auch im Bildbeschreibenâ, sagte Juan.
Thema
- Besuchen Sie die Website  um mehr ĂŒber Computer Vision zu erfahren ()
- Lesen Sie den ArtikelÂ
Vergleichen Sie die Ergebnisse der Bildbeschreibung, die das System frĂŒher und jetzt mit KI lieferte.

Foto aus der Getty Images-Bibliothek. Vorherige Beschreibung: Nahaufnahme einer Person, die einen Hotdog auf einem Schneidebrett zubereitet. Neue Beschreibung: Eine Person macht Brot.

Foto aus der Getty Images-Bibliothek. Vorherige Beschreibung: Eine Person sitzt bei Sonnenuntergang. Neue Beschreibung: Ein Lagerfeuer am Strand.

Foto aus der Getty Images-Bibliothek. Vorherige Beschreibung: Ein Mann in einem blauen Hemd. Neue Beschreibung: Mehrere Personen mit chirurgischen Masken.

Foto aus der Getty Images-Bibliothek. Vorherige Beschreibung: Ein Mann auf einem Skateboard, der an einer Wand hochfÀhrt. Neue Beschreibung: Ein Baseballspieler fÀngt einen Ball.
Quelle: habr.com
