52 set di dati per progetti di formazione

  1. Set di dati sui clienti del mall — dati sui visitatori del negozio: id, sesso, età, reddito, valutazione della spesa. (Opzione di utilizzo: Progetto di segmentazione dei clienti con Machine Learning)
  2. Set di dati Iris — set di dati per principianti, contenente le dimensioni dei sepali e dei petali per diversi fiori.
  3. Set di dati MNIST — set di dati di cifre scritte a mano. 60.000 immagini di addestramento e 10.000 immagini di test.
  4. Set di dati sulle abitazioni di Boston — set di dati popolare per il riconoscimento di pattern. Contiene informazioni sulle case a Boston: numero di appartamenti, costo dell'affitto, indice di criminalità.
  5. Set di dati sulla rilevazione delle notizie false — contiene 7796 registrazioni con etichettatura delle notizie: vero o falso. (Opzione di utilizzo con sorgente Python: Progetto di rilevazione delle notizie false in Python )
  6. Set di dati sulla qualità del vino — contiene informazioni sul vino: 4898 registrazioni con 14 parametri.
  7. Dati SOCR – Set di dati su altezze e pesi — una buona opzione per iniziare. Contiene 25.000 registrazioni sull'altezza e il peso di persone di 18 anni.

    52 set di dati per progetti di formazione

    L'articolo è stato tradotto con il supporto dell'azienda EDISON Software, che esegue perfettamente gli ordini dalla Cina meridionale, e inoltre sviluppa applicazioni web e siti.

  8. Set di dati Parkinson — 195 registrazioni sui pazienti con malattia di Parkinson, con 25 parametri di analisi. Può essere utilizzato per una valutazione preliminare delle differenze tra persone malate e sane. (Opzione di utilizzo con sorgente Python: Progetto di Machine Learning per la rilevazione della malattia di Parkinson)
  9. Set di dati Titanic — contiene informazioni sui passeggeri (età, sesso, familiari a bordo, ecc.) 891 nel set di addestramento e 418 nel set di test.
  10. Set di dati sui prelievi Uber — informazioni su 4,5 milioni di viaggi Uber del 2014 e 14 milioni del 2015. (Opzione di utilizzo con sorgente R: Progetto di analisi dei dati Uber in R)
  11. Set di dati Chars74k — contiene immagini di simboli britannici e canadesi di 64 classi: 0-9, A-Z, a-z. 7700 immagini naturali, 3400 scritte a mano, 62000 caratteri sintetizzati da computer.
  12. Set di dati sulla rilevazione delle frodi con carte di credito — contiene informazioni su transazioni di carte di credito compromesse. (Opzione di utilizzo con sorgente: Progetto di rilevazione delle frodi con carte di credito Machine Learning)
  13. Set di dati sulle intenzioni del chatbot — file JSON che contiene vari tag: saluti, addio, ricerca ospedale, ricerca farmacia, ecc. Contiene un insieme di modelli 'domanda-risposta'. (Opzione di utilizzo con sorgente Python: Progetto chatbot in Python)
  14. Set di dati delle email Enron — contiene mezzo milione di email di 150 manager di Enron.
  15. Il set di dati Yelp — contiene 1,2 milioni di recensioni di 1,6 milioni di utenti su 1,2 milioni di organizzazioni.
  16. Set di dati Jeopardy — oltre 200.000 registrazioni 'domanda-risposta' dal popolare gioco televisivo.
  17. Set di dati dei sistemi di raccomandazione — portale con una collezione di dataset dell'università UCSD. Contiene record sulle recensioni su siti popolari (Goodreads, Amazon). Ottimo per la creazione di sistemi di raccomandazione. (Opzione di utilizzo con sorgente R: Progetto di Sistema di Raccomandazione di Film in R )
  18. Dataset UCI Spambase — dataset per l'addestramento all'identificazione dello spam. Contiene 4601 email con 57 parametri di metadati.
  19. Dataset Flickr 30k — oltre 30.000 immagini e le relative didascalie. (Dataset Flickr 8k — 8000 immagini. Progetto con sorgente in Python: Generatore di Didascalie per Immagini in Python)
  20. Recensioni IMDB — 25.000 recensioni di film nel set di addestramento e 25.000 nel test. (Opzione di utilizzo con sorgente R: Progetto di Analisi del Sentiment in Data Science)
  21. Dataset MS COCO — 1,5 milioni di immagini etichettate.
  22. Dataset CIFAR-10 e CIFAR-100 — CIFAR-10 contiene 60.000 piccole immagini di dimensione 32*32 pixels con i numeri 0-9. CIFAR-100 — rispettivamente, 0-100.
  23. Dataset GTSRB (German traffic sign recognition benchmark) — 50.000 immagini di 43 segnali stradali. (Opzione di utilizzo con sorgente Python: Progetto di Riconoscimento dei Segnali Stradali in Python)
  24. Dataset ImageNet — contiene oltre 100.000 frasi e circa 1.000 immagini per frase.
  25. Dataset di Immagini di Istopatologia della Mammella — il dataset contiene immagini di campioni di cancro al seno. (Applicazione con sorgente in Progetto di Classificazione del Cancro alla Mammella in Python)
  26. Dataset Cityscapes — contiene annotazioni di alta qualità su sequenze video di strade di diverse città.
  27. Dataset Kinetics — contiene link a circa 6,5 milioni di video di alta qualità.
  28. Dataset MPII per la posa umana — il dataset contiene 25.000 immagini di pose umane con annotazioni per le articolazioni.
  29. Dataset 20BN-something-something v2 — collezione di video di alta qualità che mostrano come una persona svolge varie azioni.
  30. Dataset Object 365 — dataset di immagini di alta qualità con riquadri per gli oggetti.
  31. Dataset di Schizzi Fotografici — contiene oltre 1.000 immagini con le loro bozze contornate.
  32. Dataset CQ500 — il dataset contiene 491 scansioni CT della testa con 193.317 sezioni.
  33. Dataset IMDB-Wiki — dataset con oltre 5 milioni di immagini di volti etichettati per genere e età. (Applicazione con sorgente in Progetto di Riconoscimento di Genere e Età in Python)
  34. Dataset Youtube 8M — dataset di video etichettati che contiene 6,1 milioni di identificatori video di Youtube
  35. Dataset Urban Sound 8K — collezione di suoni urbani (contiene 8732 suoni urbani provenienti da 10 classi).
  36. Dataset LSUN — collezione di milioni di immagini colorate di scene e oggetti (circa 59 milioni di immagini, 10 diverse categorie di scene e 20 diverse categorie di oggetti).
  37. Dataset RAVDESS — database audio-visivo di discorsi emozionali. (Applicazione con sorgente in Progetto di Riconoscimento delle Emozioni Vocali)
  38. Dataset Librispeech — il dataset contiene 1000 ore di discorsi in inglese con diversi accenti.
  39. Baidu Apolloscape Dataset — dataset per lo sviluppo di tecnologie di guida autonoma.
  40. Quandl Data Portal — repository di dati economici e finanziari (contiene contenuti gratuiti e a pagamento).
  41. The World Bank Open Data Portal — informazioni sui prestiti concessi dalla Banca Mondiale ai paesi in via di sviluppo.
  42. IMF Data Portal — portale del Fondo Monetario Internazionale che pubblica dati sulle finanze internazionali, tassi di debito, investimenti, riserve valutarie e merci.
  43. American Economic Association (AEA) Data Portal — risorsa per la ricerca di dati macroeconomici degli Stati Uniti.
  44. Google Trends Data Portal — i dati sulle tendenze di Google possono essere utilizzati per esplorare e analizzare visivamente i dati.
  45. Financial Times Market Data Portal — risorsa per ottenere informazioni aggiornate sui mercati finanziari di tutto il mondo.
  46. Data.gov Portal — portale dei dati aperti del governo degli Stati Uniti (agricoltura, sanità, clima, istruzione, energia, finanze, scienza e ricerca, ecc.).
  47. Data Portal: Open government data (India) — piattaforma di dati governativi aperti dell'India.
  48. Food environment Atlas Data Portal — contiene dati di ricerche sulla nutrizione negli Stati Uniti.
  49. Health Data Portal — questo è il portale del Ministero della Salute e dei Servizi Umani degli Stati Uniti.
  50. Centers for Disease Control and Prevention Data Portal — contiene un ampio spettro di dati legati alla salute.
  51. London Datastore Portal — dati sulla vita delle persone a Londra.
  52. Canada Government Open Data Portal — portale dei dati aperti sui canadesi (agricoltura, arte, musica, istruzione, governo, sanità, ecc.).

Leggi di più

Fonte: habr.com

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster