Die neueste Technologie von Microsoft, die in Azure AI eingefĂŒhrt wurde, beschreibt Bilder ebenso gut wie Menschen.

Video abspielen

Forscher von Microsoft haben ein KI-System entwickelt, das in der Lage ist, Bildbeschreibungen zu generieren, die in vielen FĂ€llen prĂ€ziser sind als von Menschen erstellte. Dieser Durchbruch stellt einen wichtigen Meilenstein im Bestreben von Microsoft dar, seine Produkte und Dienstleistungen inklusiv und fĂŒr alle Nutzer zugĂ€nglich zu machen.

„Bildbeschreibungen sind eine der Hauptfunktionen des maschinellen Sehens, die die Arbeit einer Vielzahl von Diensten ermöglichen“, sagte Xuedong Huang (Xuedong Huang), technischer Mitarbeiter von Microsoft und Chief Technical Officer fĂŒr Azure AI Cognitive Services in Redmond (Washington).

Das neue Modell ist nun ĂŒber Computer Vision in Azure Cognitive Services, das Teil von Azure AI ist, fĂŒr Entwickler zugĂ€nglich und ermöglicht die Verbesserung der Barrierefreiheit ihrer Dienste. Es wird auch in die App Seeing AI integriert und wird Ende dieses Jahres in Microsoft Word und Outlook fĂŒr Windows und Mac sowie in PowerPoint fĂŒr Windows, Mac und in der Webversion verfĂŒgbar sein.

Die automatische Beschreibung hilft Nutzern, auf wichtige Inhalte von Bildern zuzugreifen, sei es ein Foto, das in den Suchergebnissen angezeigt wird, oder eine Illustration fĂŒr eine PrĂ€sentation.

„Die Verwendung von Bildunterschriften, die den Inhalt der Bilder beschreiben (der sogenannte alternative oder Ersatztext), auf Webseiten und in Dokumenten ist besonders wichtig fĂŒr blinde oder sehbehinderte Menschen“, bemerkte Saqib Shaikh (Saqib Shaikh), Software-Manager in der AI-Plattform-Gruppe von Microsoft in Redmond.

Sein Team nutzt beispielsweise die verbesserte Funktion zur Bildbeschreibung in der Anwendung fĂŒr blinde und sehbehinderte Menschen Seeing AI, die erkennt, was die Kamera aufnimmt, und darĂŒber berichtet. Die Anwendung verwendet generierte Bildunterschriften, um Fotos, einschließlich solcher aus sozialen Medien, zu beschreiben.

Idealerweise sollten alle alternativen Texte fĂŒr Bilder in Dokumenten, im Internet und in sozialen Medien hinzugefĂŒgt werden, da dies blinden Menschen den Zugang zu Inhalten und die Teilnahme am GesprĂ€ch ermöglicht. Leider tun dies jedoch die Menschen nicht, sagt Sheikh. Es gibt jedoch mehrere Anwendungen, die die Funktion zur Bildbeschreibung nutzen, um alternativen Text hinzuzufĂŒgen, wenn dieser fehlt.
  
Die neueste Technologie von Microsoft, die in Azure AI eingefĂŒhrt wurde, beschreibt Bilder ebenso gut wie Menschen.

Lijuan Wang, Hauptmanagerin fĂŒr Forschung im Microsoft-Labor in Redmond, leitete ein Forschungsteam, das Ergebnisse erzielte, die mit menschlichen Leistungen vergleichbar sind und diese ĂŒbertrafen. Foto: Dan DeLong.

Beschreibung neuer Objekte

„Die Beschreibung von Bildern ist eine der Hauptaufgaben der Computer Vision, die ein KI-System erfordert, um den grundlegenden Inhalt oder die Handlung, die im Bild dargestellt ist, zu verstehen und zu beschreiben“, erklĂ€rte Lijuan Wang (Lijuan Wang), Hauptmanagerin fĂŒr Forschung im Microsoft-Labor in Redmond.

„Es ist wichtig zu verstehen, was passiert, die Beziehungen zwischen Objekten und Aktionen herauszufinden und dann alles in einem fĂŒr den Menschen verstĂ€ndlichen Satz zusammenzufassen“, sagte sie.

Wang leitete eine Forschungsgruppe, die bei der Benchmarks fĂŒr das nocaps (novel object captioning at scale) Ergebnisse erzielte, die mit menschlichen Resultaten vergleichbar sind und diese sogar ĂŒbertreffen. Diese Tests bewerten, wie gut KI-Systeme Beschreibungen von abgebildeten Objekten generieren, die nicht im Datensatz enthalten sind, auf dem das Modell trainiert wurde.

Typischerweise werden Bildbeschreibungs-Systeme auf DatensÀtzen trainiert, die Bilder mit begleitenden Textbeschreibungen enthalten, also auf beschrifteten BilddatensÀtzen.

„Der nocaps-Test zeigt, wie gut das System in der Lage ist, neue Objekte zu beschreiben, die in den Trainingsdaten nicht vorkommen“, sagt Wang.

Um diese Aufgabe zu lösen, hat das Microsoft-Team ein großes KI-Modell auf einem umfangreichen Datensatz mit Bildern und Textbeschriftungen vortrainiert, wobei jede Beschriftung mit einem bestimmten Objekt im Bild verknĂŒpft wurde.

DatensĂ€tze mit Bildbeschriftungen anstelle vollstĂ€ndiger Beschreibungen sind effizienter zu erstellen, was dem Team von Wang ermöglichte, viele Daten in ihr Modell einzufĂŒhren. Durch diesen Ansatz erhielt das Modell, was das Team als visuellen Wortschatz bezeichnet.

Wie Juan erklÀrte, Àhnelt der Ansatz des Vortrainings mit einem visuellen Wortschatz der Vorbereitung von Kindern auf das Lesen: ZunÀchst wird ein Bilderbuch verwendet, in dem einzelne Wörter mit Bildern assoziiert werden, beispielsweise steht unter einem Foto eines Apfels 'Apfel', und unter einem Foto einer Katze steht das Wort 'Katze'.

„Diese Art der Vorbereitung mit einem visuellen Wortschatz ist im Grunde die Grundbildung, die notwendig ist, um das System zu schulen. So versuchen wir, eine Art motorisches GedĂ€chtnis aufzubauen“, sagte Juan.

Das vortrainierte Modell wird anschließend mit einem Datensatz verfeinert, der signierte Bilder umfasst. In dieser Trainingsphase lernt das Modell, SĂ€tze zu formulieren. Wenn ein Bild mit neuen Objekten erscheint, nutzt das KI-System ein visuelles Lexikon, um prĂ€zise Beschreibungen zu erstellen.

„Um mit neuen Objekten bei Tests umzugehen, kombiniert das System, was es wĂ€hrend des Vortrainings und der nachfolgenden Verfeinerung gelernt hat“, sagt Wang.
Laut den Ergebnissen Forschungen, schnitt das KI-System in nocaps-Tests besser ab und erstellte bedeutungsvollere und genauere Beschreibungen als Menschen fĂŒr dieselben Bilder.

Beschleunigter Übergang in die Arbeitsumgebung 

Überdies ist das neue Bildbeschreibungsystem doppelt so gut wie das Modell, das seit 2015 in Microsoft-Produkten und -Diensten verwendet wird, basierend auf einem Vergleich mit einem anderen Branchenstandard.

Angesichts der Vorteile, die alle Nutzer von Microsoft-Produkten und -Diensten durch diese Verbesserung erhalten werden, hat Juan die Integration des neuen Modells in die Arbeitsumgebung von Azure beschleunigt.

„Wir nutzen diese bahnbrechende KI-Technologie auf Azure als Plattform, um eine breitere Kundenbasis zu bedienen“, sagte er. „Und dieser Durchbruch ist nicht nur in der Forschung bemerkenswert. Die Zeit, die benötigt wurde, um diesen Durchbruch in die Azure-Umgebung zu integrieren, war ebenfalls revolutionĂ€r.“

Juan fĂŒgte hinzu, dass die Erzielung von Ergebnissen, die mit menschlichen Leistungen vergleichbar sind, den bereits etablierten Trend in Microsofts kognitiven Intelligenzsystemen fortsetzt.

„In den letzten fĂŒnf Jahren haben wir in fĂŒnf wichtigen Bereichen Ergebnisse erreicht, die mit menschlichen FĂ€higkeiten vergleichbar sind: in der Sprach­erkennung, maschinellen Übersetzung, Beantwortung von Fragen, maschinellem Lesen und TextverstĂ€ndnis. Und im Jahr 2020, trotz COVID-19, auch im Bildbeschreiben“, sagte Juan.

Thema

Vergleichen Sie die Ergebnisse der Bildbeschreibung, die das System frĂŒher und jetzt mit KI lieferte.

Die neueste Technologie von Microsoft, die in Azure AI eingefĂŒhrt wurde, beschreibt Bilder ebenso gut wie Menschen.

Foto aus der Getty Images-Bibliothek. Vorherige Beschreibung: Nahaufnahme einer Person, die einen Hotdog auf einem Schneidebrett zubereitet. Neue Beschreibung: Eine Person macht Brot.

Die neueste Technologie von Microsoft, die in Azure AI eingefĂŒhrt wurde, beschreibt Bilder ebenso gut wie Menschen.

Foto aus der Getty Images-Bibliothek. Vorherige Beschreibung: Eine Person sitzt bei Sonnenuntergang. Neue Beschreibung: Ein Lagerfeuer am Strand.

Die neueste Technologie von Microsoft, die in Azure AI eingefĂŒhrt wurde, beschreibt Bilder ebenso gut wie Menschen.

Foto aus der Getty Images-Bibliothek. Vorherige Beschreibung: Ein Mann in einem blauen Hemd. Neue Beschreibung: Mehrere Personen mit chirurgischen Masken.

Die neueste Technologie von Microsoft, die in Azure AI eingefĂŒhrt wurde, beschreibt Bilder ebenso gut wie Menschen.

Foto aus der Getty Images-Bibliothek. Vorherige Beschreibung: Ein Mann auf einem Skateboard, der an einer Wand hochfÀhrt. Neue Beschreibung: Ein Baseballspieler fÀngt einen Ball.

Quelle: habr.com

ZuverlĂ€ssiges Webhosting mit DDoS-Schutz, VPS- und VDS-Server kaufen đŸ”„ ZuverlĂ€ssiges Webhosting mit DDoS-Schutz, VPS- und VDS-Server kaufen | ProHoster