- — données des visiteurs du magasin : id, sexe, âge, revenu, classement des dépenses. (Cas d'utilisation : )
- — jeu de données pour débutants contenant les dimensions des sépales et des pétales pour différentes fleurs.
- — jeu de données de chiffres manuscrits. 60 000 images d'entraînement et 10 000 images de test.
- — jeu de données populaire pour la reconnaissance de motifs. Contient des informations sur les maisons de Boston : nombre d'appartements, coût de la location, indice de criminalité.
- — contient 7796 enregistrements étiquetés avec des nouvelles : vraies ou fausses. (Cas d'utilisation avec un code source en Python : )
- — contient des informations sur le vin : 4898 enregistrements avec 14 paramètres.
- — bon point de départ. Contient 25 000 enregistrements sur la taille et le poids de personnes de 18 ans.
Cet article a été traduit avec le soutien de la société EDISON Software, qui , ainsi que . - — 195 enregistrements sur des patients atteints de la maladie de Parkinson, avec 25 paramètres d'analyse. Peut être utilisé pour évaluer préalablement la différence entre les malades et les personnes en bonne santé. (Cas d'utilisation avec un code source en Python : )
- — contient des informations sur les passagers (âge, sexe, membres de la famille à bord, etc.) 891 dans l'ensemble d'entraînement et 418 — dans l'ensemble de test.
- — informations sur 4,5 millions de trajets Uber de 2014 et 14 millions de 2015. (Cas d'utilisation avec un code source en R : )
- — contient des images de symboles britanniques et canadiens de 64 classes : 0-9, A-Z, a-z. 7700 images naturelles, 3400 images manuscrites, 62000 polices synthétisées par ordinateur.
- — contient des informations sur des transactions avec des cartes de crédit compromises. (Cas d'utilisation avec un code source : )
- — fichier JSON contenant différentes étiquettes : salutations, adieu, recherche_hôpital, recherche_pharmacie, etc. Contient un ensemble de modèles 'question-réponse'. (Cas d'utilisation avec un code source en Python : )
- — contient un demi-million d'emails de 150 gestionnaires d'Enron.
- — contient 1,2 million de recommandations de 1,6 million d'utilisateurs sur 1,2 million d'organisations.
- — plus de 200 000 enregistrements 'question-réponse' issus d'un jeu télévisé populaire.
- — un portail avec une collection de jeux de données de l'université UCSD. Il contient des enregistrements d'avis sur des sites populaires (Goodreads, Amazon). Idéal pour créer des systèmes de recommandation. (Cas d'utilisation avec un code source en R : )
- — jeu de données pour l'entraînement à la détection de spam. Il contient 4601 courriers avec 57 paramètres de métadonnées.
- — plus de 30 000 images et leurs légendes. ( — 8000 images. Projet avec le code source en Python : )
- — 25 000 critiques de films dans le jeu d'entraînement et 25 000 dans le test. (Cas d'utilisation avec un code source en R : )
- — 1,5 million d'images annotées.
- — CIFAR-10 contient 60 000 petites images de chiffres de 0 à 9 en 32*32 pixels. CIFAR-100 contient donc des chiffres de 0 à 100.
- — 50 000 images de 43 panneaux de signalisation. (Cas d'utilisation avec un code source en Python : )
- — contient plus de 100 000 phrases et environ 1000 images par phrase.
- — le jeu de données contient des images d'échantillons de cancer du sein. (Exemple d'application avec le code source en )
- — contient des annotations de haute qualité de séquences vidéo de rues de différentes villes.
- — contient un lien URL vers environ 6,5 millions de vidéos de haute qualité.
- — le jeu de données contient 25 000 images de poses humaines avec annotation par articulation.
- — ensemble de vidéos de haute qualité montrant comment une personne effectue certaines actions.
- — jeu de données d'images de haute qualité avec des cadres environnants des objets.
- — contient plus de 1000 images avec leurs dessins de contour.
- — jeu de données contenant 491 scans CT de la tête avec 193 317 coupes.
- — jeu de données avec plus de 5 millions d'images de visages étiquetées par sexe et âge. (Exemple d'application avec le code source en )
- — ensemble de données vidéo annoté contenant 6,1 millions d'identifiants de vidéos Youtube.
- — ensemble de données de sons urbains (contient 8732 sons urbains provenant de 10 classes).
- — ensemble de données de millions d'images colorées de scènes et d'objets (environ 59 millions d'images, 10 catégories de scènes différentes et 20 catégories d'objets différentes).
- — base de données audiovisuelles de discours émotionnels. (Exemple d'application avec le code source en )
- Le jeu de données contient 1000 heures de discours en anglais avec différents accents.
- Un jeu de données pour le développement des technologies de conduite autonome.
- Un répertoire de données économiques et financières (contient des contenus gratuits et payants).
- Informations sur les prêts accordés par la Banque mondiale aux pays en développement.
- Le portail du Fonds monétaire international, qui publie des données sur les finances internationales, les taux d'endettement, les investissements, les réserves de change et les marchandises.
- Une ressource pour la recherche de données macroéconomiques américaines.
- Les données sur les tendances Google peuvent être utilisées pour une exploration et une analyse visuelles des données.
- Une ressource pour obtenir des informations à jour sur les marchés financiers du monde entier.
- Le portail de données ouvertes du gouvernement américain (agriculture, santé, climat, éducation, énergie, finances, science et recherche, etc.).
- La plateforme de données gouvernementales ouvertes de l'Inde.
- Contient des données d'étude sur la nutrition aux États-Unis.
- C'est le portail du ministère de la Santé et des Services sociaux des États-Unis.
- Contient une large gamme de données liées à la santé.
- Données sur la vie des personnes à Londres.
- Le portail de données ouvertes sur les Canadiens (agriculture, art, musique, éducation, gouvernement, santé, etc.)
Lire la suite
Source : habr.com
