- — dati sui visitatori del negozio: id, sesso, età, reddito, valutazione della spesa. (Opzione di utilizzo: )
- — set di dati per principianti, contenente le dimensioni dei sepali e dei petali per diversi fiori.
- — set di dati di cifre scritte a mano. 60.000 immagini di addestramento e 10.000 immagini di test.
- — set di dati popolare per il riconoscimento di pattern. Contiene informazioni sulle case a Boston: numero di appartamenti, costo dell'affitto, indice di criminalità.
- — contiene 7796 registrazioni con etichettatura delle notizie: vero o falso. (Opzione di utilizzo con sorgente Python: )
- — contiene informazioni sul vino: 4898 registrazioni con 14 parametri.
- — una buona opzione per iniziare. Contiene 25.000 registrazioni sull'altezza e il peso di persone di 18 anni.
L'articolo è stato tradotto con il supporto dell'azienda EDISON Software, che , e inoltre . - — 195 registrazioni sui pazienti con malattia di Parkinson, con 25 parametri di analisi. Può essere utilizzato per una valutazione preliminare delle differenze tra persone malate e sane. (Opzione di utilizzo con sorgente Python: )
- — contiene informazioni sui passeggeri (età, sesso, familiari a bordo, ecc.) 891 nel set di addestramento e 418 nel set di test.
- — informazioni su 4,5 milioni di viaggi Uber del 2014 e 14 milioni del 2015. (Opzione di utilizzo con sorgente R: )
- — contiene immagini di simboli britannici e canadesi di 64 classi: 0-9, A-Z, a-z. 7700 immagini naturali, 3400 scritte a mano, 62000 caratteri sintetizzati da computer.
- — contiene informazioni su transazioni di carte di credito compromesse. (Opzione di utilizzo con sorgente: )
- — file JSON che contiene vari tag: saluti, addio, ricerca ospedale, ricerca farmacia, ecc. Contiene un insieme di modelli 'domanda-risposta'. (Opzione di utilizzo con sorgente Python: )
- — contiene mezzo milione di email di 150 manager di Enron.
- — contiene 1,2 milioni di recensioni di 1,6 milioni di utenti su 1,2 milioni di organizzazioni.
- — oltre 200.000 registrazioni 'domanda-risposta' dal popolare gioco televisivo.
- — portale con una collezione di dataset dell'università UCSD. Contiene record sulle recensioni su siti popolari (Goodreads, Amazon). Ottimo per la creazione di sistemi di raccomandazione. (Opzione di utilizzo con sorgente R: )
- — dataset per l'addestramento all'identificazione dello spam. Contiene 4601 email con 57 parametri di metadati.
- — oltre 30.000 immagini e le relative didascalie. ( — 8000 immagini. Progetto con sorgente in Python: )
- — 25.000 recensioni di film nel set di addestramento e 25.000 nel test. (Opzione di utilizzo con sorgente R: )
- — 1,5 milioni di immagini etichettate.
- — CIFAR-10 contiene 60.000 piccole immagini di dimensione 32*32 pixels con i numeri 0-9. CIFAR-100 — rispettivamente, 0-100.
- — 50.000 immagini di 43 segnali stradali. (Opzione di utilizzo con sorgente Python: )
- — contiene oltre 100.000 frasi e circa 1.000 immagini per frase.
- — il dataset contiene immagini di campioni di cancro al seno. (Applicazione con sorgente in )
- — contiene annotazioni di alta qualità su sequenze video di strade di diverse città.
- — contiene link a circa 6,5 milioni di video di alta qualità.
- — il dataset contiene 25.000 immagini di pose umane con annotazioni per le articolazioni.
- — collezione di video di alta qualità che mostrano come una persona svolge varie azioni.
- — dataset di immagini di alta qualità con riquadri per gli oggetti.
- — contiene oltre 1.000 immagini con le loro bozze contornate.
- — il dataset contiene 491 scansioni CT della testa con 193.317 sezioni.
- — dataset con oltre 5 milioni di immagini di volti etichettati per genere e età. (Applicazione con sorgente in )
- — dataset di video etichettati che contiene 6,1 milioni di identificatori video di Youtube
- — collezione di suoni urbani (contiene 8732 suoni urbani provenienti da 10 classi).
- — collezione di milioni di immagini colorate di scene e oggetti (circa 59 milioni di immagini, 10 diverse categorie di scene e 20 diverse categorie di oggetti).
- — database audio-visivo di discorsi emozionali. (Applicazione con sorgente in )
- — il dataset contiene 1000 ore di discorsi in inglese con diversi accenti.
- — dataset per lo sviluppo di tecnologie di guida autonoma.
- — repository di dati economici e finanziari (contiene contenuti gratuiti e a pagamento).
- — informazioni sui prestiti concessi dalla Banca Mondiale ai paesi in via di sviluppo.
- — portale del Fondo Monetario Internazionale che pubblica dati sulle finanze internazionali, tassi di debito, investimenti, riserve valutarie e merci.
- — risorsa per la ricerca di dati macroeconomici degli Stati Uniti.
- — i dati sulle tendenze di Google possono essere utilizzati per esplorare e analizzare visivamente i dati.
- — risorsa per ottenere informazioni aggiornate sui mercati finanziari di tutto il mondo.
- — portale dei dati aperti del governo degli Stati Uniti (agricoltura, sanità, clima, istruzione, energia, finanze, scienza e ricerca, ecc.).
- — piattaforma di dati governativi aperti dell'India.
- — contiene dati di ricerche sulla nutrizione negli Stati Uniti.
- — questo è il portale del Ministero della Salute e dei Servizi Umani degli Stati Uniti.
- — contiene un ampio spettro di dati legati alla salute.
- — dati sulla vita delle persone a Londra.
- — portale dei dati aperti sui canadesi (agricoltura, arte, musica, istruzione, governo, sanità, ecc.).
Leggi di più
Fonte: habr.com
