La più recente tecnologia Microsoft, recentemente introdotta in Azure AI, descrive le immagini con la stessa efficacia degli esseri umani.

Riproduci video

I ricercatori di Microsoft hanno sviluppato un sistema di intelligenza artificiale in grado di generare descrizioni per le immagini, che in molti casi risultano più accurate rispetto a quelle create da esseri umani. Questa svolta rappresenta una pietra miliare importante negli sforzi di Microsoft per rendere i propri prodotti e servizi inclusivi e accessibili a tutti gli utenti.

«La descrizione delle immagini è una delle funzionalità fondamentali della visione artificiale, che rende possibile il funzionamento di una vasta gamma di servizi», ha dichiarato Xuedong Huang (Xuedong Huang), ingegnere di Microsoft e Chief Technical Officer di Azure AI Cognitive Services a Redmond (Washington).

Il nuovo modello è ora disponibile per i consumatori attraverso Computer Vision in Azure Cognitive Services, che è parte di Azure AI, e consente agli sviluppatori di utilizzare questa funzionalità per migliorare l'accessibilità dei propri servizi. È inoltre integrato nell'app Seeing AI e a fine anno sarà disponibile in Microsoft Word e Outlook per Windows e Mac, oltre che in PowerPoint per Windows, Mac e nella versione web.

La descrizione automatica aiuta gli utenti ad accedere a contenuti importanti di qualsiasi immagine, sia essa una foto restituita nei risultati di ricerca o un'illustrazione per una presentazione.

«L'uso di didascalie che descrivono il contenuto delle immagini (noto come testo alternativo o sostitutivo) sulle pagine web e nei documenti è particolarmente importante per le persone cieche o con problemi di vista», ha affermato Saqib Shaikh (Saqib Shaikh), responsabile software del gruppo piattaforme AI di Microsoft a Redmond.

Ad esempio, il suo team utilizza una funzione avanzata di descrizione delle immagini nell'applicazione per ciechi e ipovedenti Seeing AI, che riconosce ciò che inquadra la fotocamera e lo racconta. L'app utilizza didascalie generate per descrivere foto, anche sui social media.

«Idealmente, tutti dovrebbero aggiungere testo alternativo per tutte le immagini in documenti, online e nei social media, poiché ciò consente alle persone non vedenti di accedere ai contenuti e partecipare alla conversazione. Ma, purtroppo, le persone non lo fanno», afferma Sheikh. «Tuttavia, ci sono alcune applicazioni che utilizzano la funzione di descrizione delle immagini per aggiungere testo alternativo quando manca».
  
La più recente tecnologia Microsoft, recentemente introdotta in Azure AI, descrive le immagini con la stessa efficacia degli esseri umani.

Lijuan Wang, direttore della ricerca presso il laboratorio Microsoft di Redmond, ha guidato un gruppo di ricerca che ha raggiunto risultati comparabili a quelli umani, superandoli. Foto: Dan DeLong.

Descrizione dei nuovi oggetti

«La descrizione delle immagini è una delle principali sfide della visione artificiale, che richiede un sistema di intelligenza artificiale in grado di comprendere e descrivere il contenuto principale o l'azione rappresentata nell'immagine», ha spiegato Lijuan Wang (Lijuan Wang), direttore della ricerca presso il laboratorio Microsoft di Redmond.

«È fondamentale comprendere cosa sta accadendo, chiarire le relazioni tra oggetti e azioni, e poi riassumere e descrivere tutto questo in una frase in un linguaggio comprensibile per le persone», ha affermato.

Wang ha guidato un gruppo di ricerca che, durante il test di riferimento nocaps (novel object captioning at scale, descrizione di nuovi oggetti su larga scala) ha raggiunto risultati comparabili a quelli umani, superandoli. Questo test valuta quanto bene i sistemi di intelligenza artificiale generano descrizioni di oggetti rappresentati non presenti nel set di dati su cui è stata addestrata la modalità.

Di solito, i sistemi di descrizione delle immagini sono addestrati su set di dati che contengono immagini accompagnate da descrizioni testuali di queste immagini, ovvero su set di immagini etichettate.

«Il test nocaps dimostra quanto bene il sistema sia in grado di descrivere nuovi oggetti non presenti nei dati di addestramento», afferma Wang.

Per affrontare questo compito, il team di Microsoft ha precedentemente addestrato un grande modello di AI su un vasto set di dati contenente immagini con etichette testuali, ognuna delle quali era associata a un oggetto specifico nell'immagine.

Creare set di immagini con etichette testuali invece di didascalie complete è più efficace, permettendo al team di Wan di inserire molte informazioni nel proprio modello. Grazie a questo approccio, il modello ha acquisito ciò che il team definisce un vocabolario visivo.

Come ha spiegato Juan, l'approccio pre-addestrato utilizzando un vocabolario visivo è simile alla preparazione dei bambini per la lettura: inizialmente si utilizza un libro illustrato in cui singole parole sono associate a immagini, ad esempio, sotto la foto di una mela c'è scritto 'mela', mentre sotto la foto di un gatto c'è la parola 'gatto'.

«Questa preparazione preliminare tramite vocabolario visivo rappresenta essenzialmente una formazione di base necessaria per l'istruzione del sistema. Così, cerchiamo di costruire una sorta di memoria motoria», ha affermato Juan.

Il modello, dopo un pre-training, viene ulteriormente elaborato con un insieme di dati che include immagini etichettate. In questa fase di addestramento, il modello impara a formulare frasi. Quando appare un'immagine con nuovi oggetti, il sistema di intelligenza artificiale utilizza un dizionario visivo per creare descrizioni accurate.

«Per lavorare con nuovi oggetti durante i test, il sistema integra ciò che ha imparato durante il pre-training e la successiva elaborazione», afferma Wan.
Secondo i risultati della ricerca, nella valutazione dei test nocaps, il sistema di intelligenza artificiale ha creato descrizioni più sostanziose e precise rispetto agli esseri umani per le stesse immagini.

Transizione accelerata nell'ambiente di lavoro 

Inoltre, il nuovo sistema di descrizione delle immagini è due volte migliore rispetto al modello utilizzato nei prodotti e nei servizi Microsoft dal 2015, secondo un confronto con un altro benchmark del settore.

Considerando i vantaggi che tutti gli utenti dei prodotti e servizi Microsoft trarranno da questo miglioramento, Juan ha accelerato l'integrazione del nuovo modello nell'ambiente di lavoro di Azure.

«Stiamo utilizzando questa tecnologia innovativa di IA su Azure come piattaforma per servire una gamma più ampia di clienti», ha dichiarato. «E questa è una pietra miliare non solo nella ricerca. Anche il tempo necessario per integrare questa innovazione nell'ambiente Azure è stato un progresso».

Juan ha aggiunto che raggiungere risultati comparabili a quelli umani continua una tendenza già consolidata nei sistemi di intelligenza cognitiva di Microsoft.

«Negli ultimi cinque anni abbiamo raggiunto risultati comparabili a quelli umani in cinque aree principali: nel riconoscimento vocale, nella traduzione automatica, nelle risposte a domande, nella lettura automatica e nella comprensione del testo, e nel 2020, nonostante il COVID-19, nella descrizione delle immagini», ha affermato Juan.

A proposito

Confronta i risultati delle descrizioni delle immagini forniti dal sistema in passato e attualmente con l'IA

La più recente tecnologia Microsoft, recentemente introdotta in Azure AI, descrive le immagini con la stessa efficacia degli esseri umani.

Foto dalla biblioteca di Getty Images. Descrizione precedente: Primo piano di una persona che prepara un hot dog su un tagliere. Nuova descrizione: Una persona fa del pane.

La più recente tecnologia Microsoft, recentemente introdotta in Azure AI, descrive le immagini con la stessa efficacia degli esseri umani.

Foto dalla biblioteca di Getty Images. Descrizione precedente: Una persona seduta al tramonto. Nuova descrizione: Un falò sulla spiaggia.

La più recente tecnologia Microsoft, recentemente introdotta in Azure AI, descrive le immagini con la stessa efficacia degli esseri umani.

Foto dalla biblioteca di Getty Images. Descrizione precedente: Uomo in camicia blu. Nuova descrizione: Diverse persone in maschere chirurgiche.

La più recente tecnologia Microsoft, recentemente introdotta in Azure AI, descrive le immagini con la stessa efficacia degli esseri umani.

Foto dalla biblioteca di Getty Images. Descrizione precedente: Un uomo su uno skateboard vola sopra un muro. Nuova descrizione: Un giocatore di baseball che afferra una palla.

Fonte: habr.com

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster