52 zestawy danych do projektów treningowych

  1. Zbiór danych klientów sklepu — dane odwiedzających sklep: id, płeć, wiek, dochód, ocena wydatków. (Przykład zastosowania: Projekt segmentacji klientów z wykorzystaniem uczenia maszynowego)
  2. Zbiór danych Iris — zbiór danych dla początkujących, zawierający rozmiary działek i płatków dla różnych kwiatów.
  3. Zbiór danych MNIST — zbiór danych ręcznie pisanych cyfr. 60 000 obrazów treningowych i 10 000 obrazów testowych.
  4. Zbiór danych mieszkań w Bostonie — popularny zbiór danych do rozpoznawania wzorców. Zawiera informacje o domach w Bostonie: liczba mieszkań, koszt wynajmu, wskaźnik przestępczości.
  5. Zbór danych do wykrywania fałszywych wiadomości — zawiera 7796 rekordów z oznaczeniem wiadomości: prawda lub fałsz. (Przykład zastosowania z kodem źródłowym w Pythonie: Projekt wykrywania fałszywych wiadomości w Pythonie )
  6. Zbiór danych o jakości wina — zawiera informacje o winie: 4898 rekordów z 14 parametrami.
  7. Dane SOCR – Zbiór danych o wysokościach i wagach — dobry wybór na początek. Zawiera 25 000 rekordów o wzroście i wadze 18-latków.

    52 zestawy danych do projektów treningowych

    Artykuł został przetłumaczony przy wsparciu firmy EDISON Software, która wykonuje „znakomicie” zamówienia z Południowych Chin, a także rozwija aplikacje internetowe i strony.

  8. Zbiór danych Parkinsona — 195 rekordów o pacjentach z chorobą Parkinsona, zawierających 25 parametrów badań. Można wykorzystać do wstępnej oceny różnic między chorymi a zdrowymi. (Przykład zastosowania z kodem źródłowym w Pythonie: Projekt uczenia maszynowego na wykrywanie choroby Parkinsona)
  9. Zbór danych Titanic — zawiera informacje o pasażerach (wiek, płeć, krewni na pokładzie itp.) 891 w zbiorze treningowym i 418 — w testowym.
  10. Zbór danych o przejazdach Ubera — informacje o 4,5 milionie przejazdów Ubera z 2014 roku i 14 milionach z 2015 roku. (Przykład zastosowania z kodem źródłowym w R: Projekt analizy danych Ubera w R)
  11. Zbiór danych Chars74k — zawiera obrazy brytyjskich i kanadyjskich symboli 64 klas: 0-9, A-Z, a-z. 7700 naturalnych obrazów, 3400 ręcznie pisanych, 62000 syntetycznych czcionek.
  12. Zbiór danych o oszustwach kredytowych — zawiera informacje o transakcjach z kompromitowanych kart kredytowych. (Przykład zastosowania z kodem źródłowym: Projekt wykrywania oszustw kredytowych z wykorzystaniem uczenia maszynowego)
  13. Zbiór danych intencji czatbota — plik JSON, który zawiera różne tagi: powitania, pożegnania, wyszukiwanie szpitali, wyszukiwanie aptek itp. Zawiera zestaw szablonów «pytanie-odpowiedź». (Przykład zastosowania z kodem źródłowym w Pythonie: Projekt czatbota w Pythonie)
  14. Zbiór danych e-maili Enron — zawiera pół miliona e-maili od 150 menedżerów Enron.
  15. Zbiór danych Yelp — zawiera 1,2 miliona rekomendacji od 1,6 miliona użytkowników na temat 1,2 miliona organizacji.
  16. Zbiór danych Jeopardy — ponad 200 000 rekordów «pytanie-odpowiedź» z popularnej telewizyjnej gry.
  17. Zbiór danych systemów rekomendacji — portal z kolekcją zestawów danych z Uniwersytetu UCSD. Zawiera informacje o recenzjach na popularnych stronach (Goodreads, Amazon). Doskonałe do tworzenia systemów rekomendacyjnych. (Przykład zastosowania z kodem źródłowym w R: Projekt systemu rekomendacji filmów w R )
  18. Zestaw danych UCI Spambase — zestaw danych do treningu wykrywania spamu. Zawiera 4601 e-maili z 57 parametrami metadanych.
  19. Zestaw danych Flickr 30k — ponad 30 000 obrazów i ich podpisów. (Zestaw danych Flickr 8k — 8000 obrazów. Projekt z przykładem w Pythonie: Generator podpisów obrazów w Pythonie)
  20. Recenzje IMDB — 25 000 recenzji filmów w zbiorze treningowym i 25 000 w testowym. (Przykład zastosowania z kodem źródłowym w R: Projekt analizy sentymentu w Data Science)
  21. Zestaw danych MS COCO — 1,5 miliona oznaczonych obrazów.
  22. Zestaw danych CIFAR-10 i CIFAR-100 — CIFAR-10 zawiera 60 000 małych obrazów 32*32 piksele cyfr 0-9. CIFAR-100 — odpowiednio, 0-100.
  23. Zestaw danych GTSRB (benchmark rozpoznawania znaków drogowych w Niemczech) — 50 000 obrazów 43 znaków drogowych. (Przykład zastosowania z kodem źródłowym w Pythonie: Projekt rozpoznawania znaków drogowych w Pythonie)
  24. Zestaw danych ImageNet — zawiera ponad 100 000 fraz i około 1000 obrazów na frazę.
  25. Zestaw danych obrazów histopatologicznych piersi — zestaw danych zawiera obrazy próbek raka piersi. (Zastosowanie z przykładem w Projekt klasyfikacji nowotworu piersi w Pythonie)
  26. Zestaw danych Cityscapes — zawiera wysokiej jakości adnotacje sekwencji wideo ulic różnych miast.
  27. Zestaw danych Kinetics — zawiera link URL do około 6,5 miliona wysokiej jakości wideo.
  28. Zestaw danych MPII dotyczący pozycji człowieka — zestaw danych zawiera 25 000 obrazów ludzkich pozycji z adnotacjami dotyczącymi stawów.
  29. Zestaw danych 20BN-something-something v2 — zestaw wysokiej jakości wideo, które pokazują, jak człowiek wykonuje różne czynności.
  30. Zestaw danych Object 365 — zestaw danych wysokiej jakości obrazów z ograniczonymi ramkami obiektów.
  31. Zestaw danych szkiców zdjęć — zawiera ponad 1000 obrazów z ich konturowymi szkicami.
  32. Zestaw danych CQ500 — zestaw danych zawiera 491 skanów CT głowy z 193 317 przekrojami.
  33. Zestaw danych IMDB-Wiki — zestaw danych z ponad 5 milionami obrazów twarzy z oznaczeniami płci i wieku. (Zastosowanie z przykładem w Projekt wykrywania płci i wieku w Pythonie)
  34. Zestaw danych Youtube 8M — oznaczony zestaw danych wideo, który zawiera 6,1 miliona identyfikatorów wideo Youtube
  35. Zestaw danych Urban Sound 8K — zestaw danych miejskich dźwięków (zawiera 8732 dźwięki miejskie z 10 klas).
  36. Zestaw danych LSUN — zestaw danych z milionów kolorowych obrazów scen i obiektów (około 59 milionów obrazów, 10 różnych kategorii scen i 20 różnych kategorii obiektów).
  37. Zestaw danych RAVDESS — audiowizualna baza danych emocjonalnej mowy. (Zastosowanie z przykładem w Projekt rozpoznawania emocji w mowie w Pythonie)
  38. Zestaw danych Librispeech — zestaw danych zawiera 1000 godzin angielskiej mowy z różnymi akcentami.
  39. Zbiór danych Baidu Apolloscape — zbiór danych do rozwoju technologii autonomicznego prowadzenia.
  40. Portal danych Quandl — zbiór danych ekonomicznych i finansowych (dostępny z treściami bezpłatnymi i płatnymi).
  41. Portal otwartych danych Banku Światowego — informacje o pożyczkach udzielonych przez Bank Światowy krajom rozwijającym się.
  42. Portal danych MFW — portal Międzynarodowego Funduszu Walutowego, który publikuje dane o finansach międzynarodowych, stopach zadłużenia, inwestycjach, rezerwach walutowych i towarach.
  43. Portal danych Amerykańskiego Stowarzyszenia Ekonomicznego (AEA) — zasób do wyszukiwania danych makroekonomicznych w USA.
  44. Portal danych Google Trends — dane o trendach Google można wykorzystać do wizualizacji i analizy danych.
  45. Portal danych rynkowych Financial Times — zasób do uzyskiwania aktualnych informacji o rynkach finansowych z całego świata.
  46. Portal Data.gov — portal otwartych danych rządu USA (rolnictwo, zdrowie, klimat, edukacja, energia, finanse, nauka i badania itp.).
  47. Portal danych: Otwarte dane rządowe (Indie) — otwarta platforma danych rządowych Indii.
  48. Portal danych dotyczących środowiska żywieniowego — zawiera dane badań dotyczących żywienia w USA.
  49. Portal danych zdrowotnych — to portal Departamentu Zdrowia i Opieki Społecznej USA.
  50. Portal danych Centrów Kontroli i Zapobiegania Chorobom — zawiera szeroki wachlarz danych związanych ze zdrowiem.
  51. Portal London Datastore — dane o życiu ludzi w Londynie.
  52. Portal otwartych danych rządu Kanady — portal otwartych danych o Kanadyjczykach (rolnictwo, sztuka, muzyka, edukacja, rząd, zdrowie itp.)

Czytaj więcej

Źródło: habr.com

Kup niezawodny hosting stron z ochroną DDoS, serwery VPS VDS 🔥 Kup niezawodny hosting stron z ochroną DDoS, serwery VPS VDS - ProHoster