52 DatensĂ€tze fĂŒr Trainingsprojekte.

  1. Kundendatenbank fĂŒr Einkaufszentren — Daten der Ladenbesucher: ID, Geschlecht, Alter, Einkommen, Ausgabenbewertung. (Anwendungsbeispiel: Kundenklassifizierungsprojekt mit maschinellem Lernen)
  2. Iris-Datensatz — ein Einsteiger-Datensatz, der die Maße der KelchblĂ€tter und BlĂŒtenblĂ€tter fĂŒr verschiedene Blumen enthĂ€lt.
  3. MNIST-Datensatz — ein Datensatz handgeschriebener Ziffern. 60.000 Trainingsbilder und 10.000 Testbilder.
  4. Der Boston Housing Dataset — ein beliebter Datensatz zur Mustererkennung. EnthĂ€lt Informationen ĂŒber HĂ€user in Boston: Anzahl der Wohnungen, Mietpreise, KriminalitĂ€tsindex.
  5. Datensatz zur Fake-News-Erkennung — enthĂ€lt 7796 EintrĂ€ge mit Nachrichtenmarkierungen: wahr oder falsch. (Anwendungsbeispiel mit Python-Quellcode: Fake News Detection Python-Projekt )
  6. WeinqualitĂ€tsdatensatz — enthĂ€lt Informationen ĂŒber Wein: 4898 EintrĂ€ge mit 14 Parametern.
  7. SOCR-Daten – Datensatz zu KörpergrĂ¶ĂŸe und Gewicht — eine gute Wahl fĂŒr den Einstieg. EnthĂ€lt 25.000 EintrĂ€ge ĂŒber die GrĂ¶ĂŸe und das Gewicht 18-jĂ€hriger Personen.

    52 DatensĂ€tze fĂŒr Trainingsprojekte.

    Der Artikel wurde mit UnterstĂŒtzung von EDISON Software ĂŒbersetzt, einem Unternehmen, das fĂŒhrt Bestellungen aus SĂŒdchina „ausgezeichnet“ aus, sowie entwickelt Webanwendungen und Webseiten.

  8. Parkinson-Datensatz — 195 EintrĂ€ge ĂŒber Patienten mit Parkinson-Krankheit, mit 25 Parameteranalysen. Kann zur ersten EinschĂ€tzung des Unterschieds zwischen kranken und gesunden Personen verwendet werden. (Anwendungsbeispiel mit Python-Quellcode: Maschinenlernprojekt zur Erkennung von Parkinson-Krankheit)
  9. Titanic-Datensatz — enthĂ€lt Informationen ĂŒber Passagiere (Alter, Geschlecht, Angehörige an Bord usw.) 891 im Trainingsset und 418 im Testset.
  10. Uber Pickups Dataset — enthĂ€lt Informationen ĂŒber 4,5 Millionen Fahrten mit Uber im Jahr 2014 und 14 Millionen im Jahr 2015. (Anwendung mit Ausgangscode in R: Uber Datenanalyse-Projekt in R)
  11. Chars74k Dataset — enthĂ€lt Bilder britischer und kanadischer Symbole in 64 Klassen: 0-9, A-Z, a-z. 7700 natĂŒrliche Bilder, 7,7k handgeschriebene, 3400k synthetisierte Computer-Schriften.
  12. Credit Card Fraud Detection Dataset — enthĂ€lt Informationen zu Transaktionen mit kompromittierten Kreditkarten. (Anwendung mit Ausgangscode: Credit Card Fraud Detection Machine Learning Projekt)
  13. Chatbot Intents Dataset — JSON-Datei, die verschiedene Tags enthĂ€lt: greetings, goodbye, hospital_search, pharmacy_search usw. Sie enthĂ€lt eine Sammlung von "Frage-Antwort"-Vorlagen. (Anwendungsbeispiel mit Python-Quellcode: Chatbot Projekt in Python)
  14. Enron Email Dataset — enthĂ€lt eine halbe Million E-Mails von 150 Enron-Managern.
  15. The Yelp Dataset — enthĂ€lt 1,2 Millionen Empfehlungen von 1,6 Millionen Nutzern ĂŒber 1,2 Millionen Organisationen.
  16. Jeopardy Dataset — mehr als 200.000 "Frage-Antwort"-EintrĂ€ge aus dem beliebten TV-Quiz.
  17. Recommender Systems Dataset — ein Portal mit einer Sammlung von DatensĂ€tzen der UCSD-UniversitĂ€t. EnthĂ€lt Aufzeichnungen von Bewertungen auf beliebten Websites (Goodreads, Amazon). Ideal fĂŒr die Erstellung von Empfehlungssystemen. (Anwendung mit Ausgangscode in R: Projekt zur Filmempfehlung in R )
  18. UCI Spambase-Datensatz — ein Datensatz zum Training zur Spam-Erkennung. EnthĂ€lt 4601 E-Mails mit 57 Metadaten-Parametern.
  19. Flickr 30k-Datensatz — ĂŒber 30.000 Bilder und deren Beschriftungen. (Flickr 8k-Datensatz — 8000 Bilder. Projekt mit Source-Code in Python: Image Caption Generator Python-Projekt)
  20. IMDB-Bewertungen — 25.000 Bewertungen zu Filmen im Trainingssatz und 25.000 im Testset. (Anwendung mit Ausgangscode in R: Sentiment-Analyse Data Science-Projekt)
  21. MS COCO-Datensatz — 1,5 Millionen annotierte Bilder.
  22. CIFAR-10 und CIFAR-100-Datensatz — CIFAR-10 enthĂ€lt 60.000 kleine Bilder mit 32*32 Pixeln von Ziffern 0-9. CIFAR-100 — entsprechend 0-100.
  23. GTSRB (German Traffic Sign Recognition Benchmark) Datensatz — 50.000 Bilder von 43 Verkehrszeichen. (Anwendungsbeispiel mit Python-Quellcode: Projekt zur Verkehrsschildererkennung in Python)
  24. ImageNet-Datensatz — enthĂ€lt mehr als 100.000 Phrasen und ungefĂ€hr 1000 Bilder pro Phrase.
  25. Datensatz mit histopathologischen Bildern der Brust — der Datensatz enthĂ€lt Bilder von Brustkrebsproben. (Anwendungsbeispiel mit Source-Code in Python-Projekt zur Brustkrebs-Klassifikation)
  26. Cityscapes-Datensatz — enthĂ€lt qualitativ hochwertige Annotationen von Videoaufzeichnungen in Straßen verschiedener StĂ€dte.
  27. Kinetics-Datensatz — enthĂ€lt einen URL-Link zu etwa 6,5 Millionen hochwertigen Videos.
  28. MPII menschliches Posedatensatz — der Datensatz enthĂ€lt 25.000 Bilder menschlicher Posen mit Gelenkannotationen.
  29. 20BN-something-something Datensatz v2 — eine Sammlung hochwertiger Videos, die zeigen, wie eine Person bestimmte Handlungen ausfĂŒhrt.
  30. Object 365 Datensatz — ein Datensatz hochwertiger Bilder mit begrenzenden Rahmen fĂŒr Objekte.
  31. Photo Sketching Datensatz — enthĂ€lt ĂŒber 1000 Bilder mit ihren Umrisszeichnungen.
  32. CQ500 Datensatz — der Datensatz enthĂ€lt 491 Kopf-CT-Scans mit 193.317 Schnitten.
  33. IMDB-Wiki Datensatz — ein Datensatz mit ĂŒber 5 Millionen Bilder von Gesichtern mit Geschlechts- und Altersmarkierungen. (Anwendungsbeispiel mit Source-Code in Gender & Age Detection Python-Projekt)
  34. YouTube 8M Datensatz — ein gekennzeichneter Videosatz, der 6,1 Millionen YouTube-Video-IDs enthĂ€lt.
  35. Urban Sound 8K Datensatz — eine Sammlung stĂ€dtischer Audiodaten (enthĂ€lt 8732 stĂ€dtische GerĂ€usche aus 10 Klassen).
  36. LSUN Datensatz — ein Datensatz von Millionen farbiger Bilder von Szenen und Objekten (etwa 59 Millionen Bilder, 10 verschiedene Szenenkategorien und 20 verschiedene Objektkategorien).
  37. RAVDESS Datensatz — audiovisuelle Datenbank emotionaler Sprache. (Anwendungsbeispiel mit Source-Code in Speech Emotion Recognition Python-Projekt)
  38. Librispeech Datensatz — Der Datensatz enthĂ€lt 1000 Stunden englischer Sprache mit verschiedenen Akzenten.
  39. Baidu Apolloscape Dataset — Datensatz zur Entwicklung von Technologien fĂŒr autonomes Fahren.
  40. Quandl Data Portal — Lager fĂŒr wirtschaftliche und finanzielle Daten (es gibt kostenlose und kostenpflichtige Inhalte).
  41. Das Open Data Portal der Weltbank — Informationen ĂŒber Kredite, die der Weltbank an EntwicklungslĂ€nder gewĂ€hrt wurden.
  42. IMF Data Portal — Portal des Internationalen WĂ€hrungsfonds, das Daten zu internationalen Finanzen, Schuldenzinsen, Investitionen, WĂ€hrungsreserven und Waren veröffentlicht.
  43. Datenportal der American Economic Association (AEA) — Ressource zur Suche nach makroökonomischen Daten der USA.
  44. Google Trends Data Portal — Daten zu Google Trends lassen sich fĂŒr visuelle Studien und Analysen verwenden.
  45. Financial Times Market Data Portal — Ressource zur Beschaffung aktueller Informationen ĂŒber die FinanzmĂ€rkte weltweit.
  46. Data.gov Portal — Portal fĂŒr offene Daten der US-Regierung (Landwirtschaft, Gesundheitswesen, Klima, Bildung, Energie, Finanzen, Wissenschaft und Forschung usw.).
  47. Datenportal: Offene Regierungsdaten (Indien) — Offene Regierungsdatenplattform von Indien.
  48. Food Environment Atlas Data Portal — EnthĂ€lt Daten aus Studien ĂŒber ErnĂ€hrung in den USA.
  49. Health Data Portal — ist ein Portal des Ministeriums fĂŒr Gesundheit und Soziale Dienste der USA.
  50. Datenportal der Centers for Disease Control and Prevention — bietet eine breite Palette von gesundheitsbezogenen Daten.
  51. Portal des London Datastore — Daten ĂŒber das Leben der Menschen in London.
  52. Regierungsportal fĂŒr offene Daten Kanadas — ein Portal fĂŒr offene Daten ĂŒber Kanadier (Landwirtschaft, Kunst, Musik, Bildung, Regierung, Gesundheitswesen usw.)

Mehr lesen

Quelle: habr.com

ZuverlĂ€ssiges Webhosting mit DDoS-Schutz, VPS- und VDS-Server kaufen đŸ”„ ZuverlĂ€ssiges Webhosting mit DDoS-Schutz, VPS- und VDS-Server kaufen | ProHoster