- — date despre vizitatorii magazinului: id, sex, vârstă, venit, rating cheltuieli. (Exemplu de utilizare: )
- — set de date pentru începători, conținând dimensiunile sepalei și petalelor pentru diferite flori.
- — set de date cu cifre scrise de mână. 60 000 de imagini de antrenament și 10 000 de imagini de test.
- — set de date popular pentru recunoașterea modelului. Conține informații despre casele din Boston: numărul de apartamente, prețul chiriei, indicele de criminalitate.
- — conține 7796 de înregistrări etichetați ca fiind adevărate sau false. (Exemplu de utilizare cu cod sursă în Python: )
- — conține informații despre vin: 4898 de înregistrări cu 14 parametri.
- — o opțiune bună pentru început. Conține 25 000 de înregistrări despre altura și greutatea persoanelor de 18 ani.
Articolul a fost tradus cu sprijinul companiei EDISON Software, care , dar și pentru . - — 195 de înregistrări despre pacienți cu boala Parkinson, cu 25 de parametrii de analiză. Poate fi folosit pentru evaluarea preliminară a diferențelor între persoanele bolnave și cele sănătoase. (Exemplu de utilizare cu cod sursă în Python: )
- — conține informații despre pasageri (vârstă, sex, rude la bord etc.) 891 în setul de antrenament și 418 în cel de test.
- — informații despre 4.5 milioane de curse Uber din 2014 și 14 milioane din 2015. (Exemplu de utilizare cu cod sursă în R: )
- — conține imagini cu simboluri britanice și canadiene din 64 de clase: 0-9, A-Z, a-z. 7700 7.7k imagini naturale, 3400k scrise de mână, 62000 fonturi sintetizate de computer.
- — conține informații despre tranzacții cu carduri de credit compromise. (Exemplu de utilizare cu cod sursă: )
- — fișier JSON care conține diferite etichete: salutări, rămas bun, căutare spital, căutare farmacie etc. Conține un set de șabloane 'întrebare-răspuns'. (Exemplu de utilizare cu cod sursă în Python: )
- — conține o jumătate de milion de emailuri de la 150 de manageri Enron.
- — conține 1,2 milioane de recenzii de la 1,6 milioane de utilizatori despre 1,2 milioane de organizații.
- — mai mult de 200 000 de înregistrări 'întrebare-răspuns' din jocul TV popular.
- — un portal cu o colecție de seturi de date de la Universitatea UCSD. Conține înregistrări despre recenzii pe site-uri populare (Goodreads, Amazon). Ideal pentru crearea de sisteme de recomandare. (Exemplu de utilizare cu cod sursă în R: )
- — set de date pentru antrenament pentru detectarea spamului. Conține 4601 de e-mailuri cu 57 de parametrii de metadate.
- — peste 30.000 de imagini și descrieri ale acestora. ( — 8000 de imagini. Proiect cu sursa în Python: )
- — 25.000 de recenzii de filme în setul de antrenament și 25.000 în testare. (Exemplu de utilizare cu cod sursă în R: )
- — 1,5 milioane de imagini etichetate.
- — CIFAR-10 conține 60.000 de imagini mici de 32*32 pixeli cu cifre de la 0 la 9. CIFAR-100 — respectiv, de la 0 la 100.
- — 50.000 de imagini cu 43 de semne de trafic. (Exemplu de utilizare cu cod sursă în Python: )
- — conține peste 100.000 de fraze și aproximativ 1000 de imagini pe frază.
- — setul de date conține imagini ale probelor de cancer de sân. (Aplicare cu sursa la )
- — conține anotări de înaltă calitate pentru secvențe video ale străzilor din diverse orașe.
- — conține un link URL către aproximativ 6,5 milioane de videoclipuri de înaltă calitate.
- — setul de date conține 25.000 de imagini cu posturi umane etichetate pe articulații.
- — set de videoclipuri de înaltă calitate care arată cum o persoană efectuează diverse acțiuni.
- — setul de date de imagini de înaltă calitate cu cadre limitative pentru obiecte.
- — conține peste 1000 de imagini cu contururile acestora.
- — setul de date conține 491 de scanări CT ale capului cu 193.317 secțiuni.
- — set de date cu peste 5 milioane de imagini ale fețelor, etichetate cu gen și vârstă. (Aplicare cu sursa la )
- — set de date etichetate cu videoclipuri, care conține 6,1 milioane de identificatori de videoclipuri Youtube
- — set de date de sunete urbane (conține 8732 de sunete urbane din 10 clase).
- — set de date din milioane de imagini colorate ale scenelor și obiectelor (aproximativ 59 de milioane de imagini, 10 categorii diferite de scene și 20 de categorii diferite de obiecte).
- — o bază de date audiovizuală a vorbirii emoționale. (Aplicare cu sursa la )
- — setul de date conține 1000 de ore de discurs în limba engleză cu diferite accente.
- — setul de date pentru dezvoltarea tehnologiilor de conducere autonomă.
- — depozit de date economice și financiare (există conținut gratuit și plătit).
- — informații despre împrumuturile acordate de Banca Mondială țărilor în dezvoltare.
- — portalul Fondului Monetar Internațional care publică date despre finanțele internaționale, ratele datoriei, investiții, rezerve valutare și mărfuri.
- — resursă pentru găsirea datelor macroeconomice din Statele Unite.
- — datele despre tendințele Google pot fi utilizate pentru a explora și analiza vizual datele.
- — resursă pentru obținerea de informații actuale despre piețele financiare din întreaga lume.
- — portalul de date deschise al guvernului SUA (agricultură, sănătate, climă, educație, energie, finanțe, știință și cercetare etc.).
- — platforma deschisă de date ale guvernului Indiei.
- — conține date cercetări despre alimentația din SUA.
- — acesta este portalul Ministerului Sănătății și Serviciilor Sociale din SUA.
- — conține o gamă largă de date legate de sănătate.
- — date despre viața oamenilor din Londra.
- — portalul de date deschise despre canadieni (agricultură, artă, muzică, educație, guvern, sănătate etc.).
Citește mai mult
Sursa: habr.com
