- — dane odwiedzających sklep: id, płeć, wiek, dochód, ocena wydatków. (Przykład zastosowania: )
- — zbiór danych dla początkujących, zawierający rozmiary działek i płatków dla różnych kwiatów.
- — zbiór danych ręcznie pisanych cyfr. 60 000 obrazów treningowych i 10 000 obrazów testowych.
- — popularny zbiór danych do rozpoznawania wzorców. Zawiera informacje o domach w Bostonie: liczba mieszkań, koszt wynajmu, wskaźnik przestępczości.
- — zawiera 7796 rekordów z oznaczeniem wiadomości: prawda lub fałsz. (Przykład zastosowania z kodem źródłowym w Pythonie: )
- — zawiera informacje o winie: 4898 rekordów z 14 parametrami.
- — dobry wybór na początek. Zawiera 25 000 rekordów o wzroście i wadze 18-latków.
Artykuł został przetłumaczony przy wsparciu firmy EDISON Software, która , a także . - — 195 rekordów o pacjentach z chorobą Parkinsona, zawierających 25 parametrów badań. Można wykorzystać do wstępnej oceny różnic między chorymi a zdrowymi. (Przykład zastosowania z kodem źródłowym w Pythonie: )
- — zawiera informacje o pasażerach (wiek, płeć, krewni na pokładzie itp.) 891 w zbiorze treningowym i 418 — w testowym.
- — informacje o 4,5 milionie przejazdów Ubera z 2014 roku i 14 milionach z 2015 roku. (Przykład zastosowania z kodem źródłowym w R: )
- — zawiera obrazy brytyjskich i kanadyjskich symboli 64 klas: 0-9, A-Z, a-z. 7700 naturalnych obrazów, 3400 ręcznie pisanych, 62000 syntetycznych czcionek.
- — zawiera informacje o transakcjach z kompromitowanych kart kredytowych. (Przykład zastosowania z kodem źródłowym: )
- — plik JSON, który zawiera różne tagi: powitania, pożegnania, wyszukiwanie szpitali, wyszukiwanie aptek itp. Zawiera zestaw szablonów «pytanie-odpowiedź». (Przykład zastosowania z kodem źródłowym w Pythonie: )
- — zawiera pół miliona e-maili od 150 menedżerów Enron.
- — zawiera 1,2 miliona rekomendacji od 1,6 miliona użytkowników na temat 1,2 miliona organizacji.
- — ponad 200 000 rekordów «pytanie-odpowiedź» z popularnej telewizyjnej gry.
- — portal z kolekcją zestawów danych z Uniwersytetu UCSD. Zawiera informacje o recenzjach na popularnych stronach (Goodreads, Amazon). Doskonałe do tworzenia systemów rekomendacyjnych. (Przykład zastosowania z kodem źródłowym w R: )
- — zestaw danych do treningu wykrywania spamu. Zawiera 4601 e-maili z 57 parametrami metadanych.
- — ponad 30 000 obrazów i ich podpisów. ( — 8000 obrazów. Projekt z przykładem w Pythonie: )
- — 25 000 recenzji filmów w zbiorze treningowym i 25 000 w testowym. (Przykład zastosowania z kodem źródłowym w R: )
- — 1,5 miliona oznaczonych obrazów.
- — CIFAR-10 zawiera 60 000 małych obrazów 32*32 piksele cyfr 0-9. CIFAR-100 — odpowiednio, 0-100.
- — 50 000 obrazów 43 znaków drogowych. (Przykład zastosowania z kodem źródłowym w Pythonie: )
- — zawiera ponad 100 000 fraz i około 1000 obrazów na frazę.
- — zestaw danych zawiera obrazy próbek raka piersi. (Zastosowanie z przykładem w )
- — zawiera wysokiej jakości adnotacje sekwencji wideo ulic różnych miast.
- — zawiera link URL do około 6,5 miliona wysokiej jakości wideo.
- — zestaw danych zawiera 25 000 obrazów ludzkich pozycji z adnotacjami dotyczącymi stawów.
- — zestaw wysokiej jakości wideo, które pokazują, jak człowiek wykonuje różne czynności.
- — zestaw danych wysokiej jakości obrazów z ograniczonymi ramkami obiektów.
- — zawiera ponad 1000 obrazów z ich konturowymi szkicami.
- — zestaw danych zawiera 491 skanów CT głowy z 193 317 przekrojami.
- — zestaw danych z ponad 5 milionami obrazów twarzy z oznaczeniami płci i wieku. (Zastosowanie z przykładem w )
- — oznaczony zestaw danych wideo, który zawiera 6,1 miliona identyfikatorów wideo Youtube
- — zestaw danych miejskich dźwięków (zawiera 8732 dźwięki miejskie z 10 klas).
- — zestaw danych z milionów kolorowych obrazów scen i obiektów (około 59 milionów obrazów, 10 różnych kategorii scen i 20 różnych kategorii obiektów).
- — audiowizualna baza danych emocjonalnej mowy. (Zastosowanie z przykładem w )
- — zestaw danych zawiera 1000 godzin angielskiej mowy z różnymi akcentami.
- — zbiór danych do rozwoju technologii autonomicznego prowadzenia.
- — zbiór danych ekonomicznych i finansowych (dostępny z treściami bezpłatnymi i płatnymi).
- — informacje o pożyczkach udzielonych przez Bank Światowy krajom rozwijającym się.
- — portal Międzynarodowego Funduszu Walutowego, który publikuje dane o finansach międzynarodowych, stopach zadłużenia, inwestycjach, rezerwach walutowych i towarach.
- — zasób do wyszukiwania danych makroekonomicznych w USA.
- — dane o trendach Google można wykorzystać do wizualizacji i analizy danych.
- — zasób do uzyskiwania aktualnych informacji o rynkach finansowych z całego świata.
- — portal otwartych danych rządu USA (rolnictwo, zdrowie, klimat, edukacja, energia, finanse, nauka i badania itp.).
- — otwarta platforma danych rządowych Indii.
- — zawiera dane badań dotyczących żywienia w USA.
- — to portal Departamentu Zdrowia i Opieki Społecznej USA.
- — zawiera szeroki wachlarz danych związanych ze zdrowiem.
- — dane o życiu ludzi w Londynie.
- — portal otwartych danych o Kanadyjczykach (rolnictwo, sztuka, muzyka, edukacja, rząd, zdrowie itp.)
Czytaj więcej
Źródło: habr.com
