Data Science pour débutants
1. Analyse des sentiments (Analyse des sentiments Ă travers le texte)

DĂ©couvrez l'implĂ©mentation complĂšte d'un projet Data Science avec le code source â .
L'analyse des sentiments consiste Ă examiner des mots pour dĂ©terminer les sentiments et opinions, qui peuvent ĂȘtre positifs ou nĂ©gatifs. C'est un type de classification oĂč les classes peuvent ĂȘtre binaires (positives et nĂ©gatives) ou multiples (heureux, en colĂšre, triste, dĂ©sagrĂ©able, âŠ). Nous allons rĂ©aliser ce projet Data Science en R et utiliser un jeu de donnĂ©es dans le package « janeaustenR ». Nous utiliserons des lexiques gĂ©nĂ©raux tels qu'AFINN, bing et loughran, effectuerons un joint interne, et Ă la fin, nous crĂ©erons un nuage de mots pour visualiser le rĂ©sultat.
Langue : R
Jeu de données / Package : janeaustenR
Cet article a été traduit avec le soutien de la société EDISON Software, qui , ainsi que .
2. Détection de Fake News (Détection de fausses nouvelles)
AmĂ©liorez vos compĂ©tences en travaillant sur un projet Data Science pour dĂ©butants â .

Les fausses nouvelles sont des informations erronées diffusées via les réseaux sociaux et d'autres médias en ligne dans un but politique. Dans cette idée de projet Data Science, nous allons utiliser Python pour construire un modÚle capable de déterminer avec précision si une nouvelle est réelle ou fausse. Nous créerons un TfidfVectorizer et utiliserons un PassiveAggressiveClassifier pour classifier les nouvelles en 'réelles' et 'fausses'. Nous utiliserons un jeu de données de forme 7796 à 4 et effectuerons tout cela dans Jupyter Lab.
Langue : Python
Jeu de données / Package : news.csv
3. Détection de la maladie de Parkinson (Détection de la maladie de Parkinson)
Avancez en travaillant sur l'idĂ©e du projet Data Science â .

Nous commençons Ă utiliser le Data Science pour amĂ©liorer les soins de santĂ© et les services â si nous pouvons prĂ©dire la maladie Ă un stade prĂ©coce, nous aurons de nombreux avantages. Ainsi, dans cette idĂ©e de projet Data Science, nous apprendrons Ă dĂ©tecter la maladie de Parkinson avec Python. Il s'agit d'une maladie neurodĂ©gĂ©nĂ©rative progressive du systĂšme nerveux central qui impacte le mouvement et provoque des tremblements et de la rigiditĂ©. Elle affecte les neurones producteurs de dopamine dans le cerveau, et chaque annĂ©e, elle touche plus d'un million de personnes en Inde.
Langue : Python
Jeu de données / Package : Jeu de données UCI ML Parkinsons
Projets de science des données de complexité moyenne
4. Reconnaissance des émotions par la parole
DĂ©couvrez la mise en Ćuvre complĂšte d'un projet de science des donnĂ©es â .

Apprenons maintenant à utiliser différentes bibliothÚques. Ce projet de science des données utilise librosa pour la reconnaissance vocale. La reconnaissance des émotions par la parole (SER) est le processus de détermination des émotions humaines et des états affectifs à partir de la parole. Comme nous utilisons le ton et la hauteur pour exprimer des émotions vocales, le SER est pertinent. Cependant, étant donné que les émotions sont subjectives, l'annotation du son est une tùche complexe. Nous utiliserons les fonctions mfcc, chroma et mel et le jeu de données RAVDESS pour la reconnaissance des émotions. Nous créerons un classificateur MLPC pour ce modÚle.
Langue : Python
Jeu de données / Package : Jeu de données RAVDESS
5. Détection du sexe et de l'ùge
Impressionnez les employeurs avec le dernier projet de science des donnĂ©es â .

C'est un projet de science des données avec Python. En utilisant une seule image, vous apprendrez à prédire le sexe et l'ùge d'une personne. Dans ce projet, nous vous présenterons la vision par ordinateur et ses principes. Nous construirons et utiliserons des modÚles formés par Tal Hassner et Gil Levi pour le jeu de données Adience. En cours de route, nous utiliserons certains fichiers .pb, .pbtxt, .prototxt et .caffemodel.
Langue : Python
Jeu de données / Package : Adience
6. Analyse des données Uber
DĂ©couvrez la mise en Ćuvre complĂšte du projet de science des donnĂ©es avec le code source â .

C'est un projet de visualisation de donnĂ©es avec ggplot2, oĂč nous utiliserons R et ses bibliothĂšques pour analyser diffĂ©rents paramĂštres. Nous utiliserons le jeu de donnĂ©es Uber Pickups Ă New York et crĂ©erons des visualisations pour diffĂ©rentes pĂ©riodes de l'annĂ©e. Cela nous indique comment le temps impacte les trajets des clients.
Langue : R
Jeu de données / Package : Jeu de données Uber Pickups à New York
7. Détection de la somnolence du conducteur
AmĂ©liorez vos compĂ©tences en travaillant sur le meilleur projet de science des donnĂ©es â .

La conduite somnolente est extrĂȘmement dangereuse et chaque annĂ©e, environ mille accidents se produisent Ă cause des conducteurs qui s'endorment au volant. Dans ce projet en Python, nous crĂ©erons un systĂšme capable de dĂ©tecter les conducteurs somnolents et de les alerter avec un signal sonore.
Ce projet est rĂ©alisĂ© en utilisant Keras et OpenCV. Nous allons utiliser OpenCV pour dĂ©tecter le visage et les yeux, et avec Keras, nous allons classer l'Ă©tat de l'Ćil (Ouvert ou FermĂ©) en utilisant des mĂ©thodes de rĂ©seau de neurones profonds.
8. Chatbot
CrĂ©ez un chatbot avec Python et faites un pas en avant dans votre carriĂšre â .

Les chatbots sont essentiels pour les entreprises. De nombreuses entreprises doivent offrir des services Ă leurs clients, et cela nĂ©cessite beaucoup de main-d'Ćuvre, de temps et d'efforts. Les chatbots peuvent automatiser une grande partie des interactions avec les clients, en rĂ©pondant Ă certaines questions frĂ©quentes posĂ©es par ceux-ci. En gros, il existe deux types de chatbots : spĂ©cifiques au domaine et de domaine ouvert. Le chatbot spĂ©cifique au domaine est souvent utilisĂ© pour rĂ©soudre un problĂšme particulier. Ainsi, vous devez le configurer pour qu'il fonctionne efficacement dans votre domaine. Les chatbots de domaine ouvert peuvent recevoir toutes sortes de questions, donc leur apprentissage nĂ©cessite un Ă©norme volume de donnĂ©es.
Jeu de données : Fichier json d'intentions
Langue : Python
Projets avancés en Data Science
9. Générateur de légendes d'image
VĂ©rifiez la mise en Ćuvre complĂšte du projet avec le code source â .

Décrire ce qui se trouve sur une image est une tùche facile pour les humains, mais pour les ordinateurs, une image est simplement une série de chiffres représentant la valeur de couleur de chaque pixel. C'est une tùche difficile pour les ordinateurs. Comprendre ce qu'il y a sur l'image et ensuite créer une description en langage naturel (par exemple, en anglais) est une autre tùche complexe. Ce projet utilise des méthodes d'apprentissage profond, dans lequel nous implémentons un Réseau de neurones convolutif (CNN) avec un Réseau de neurones récurrent (LSTM) pour créer un générateur de description d'image.
Jeu de données : Flickr 8K
Langue : Python
Cadre : Keras
10. Détection de fraude par carte de crédit
Faites de votre mieux en travaillant sur l'idĂ©e de projet Data Science â .

à ce stade, vous avez commencé à comprendre les méthodes et les concepts. Passons à quelques projets avancés en science des données. Dans ce projet, nous allons utiliser le langage R avec des algorithmes tels que , régression logistique, réseaux de neurones artificiels et classificateur de boosting par gradient. Nous utiliserons un ensemble de données sur les transactions par carte pour classifier les transactions de carte de crédit en tant que frauduleuses ou légitimes. Nous sélectionnerons différents modÚles pour cela et tracerons des courbes de performance.
Langue : R
Jeu de données / Package : Ensemble de données sur les transactions par carte
11. SystĂšme de recommandation de films
DĂ©couvrez la mise en Ćuvre du meilleur projet de Data Science avec le code source â

Dans ce projet de Data Science, nous utiliserons R pour effectuer des recommandations de films par le biais de l'apprentissage machine. Le systĂšme de recommandation envoie des suggestions aux utilisateurs via un processus de filtrage basĂ© sur les prĂ©fĂ©rences d'autres utilisateurs et l'historique de visionnage. Si A et B aiment Maman, j'ai ratĂ© l'avion et que B aime Les filles du calendrier, alors on peut proposer Ă A â cela pourrait aussi lui plaire. Cela permet aux clients d'interagir avec la plateforme.
Langue : R
Jeu de données / Package : Ensemble de données MovieLens
12. Segmentation des clients
Impressionnez les employeurs avec un projet de Data Science (incluant le code source) â .

La segmentation des clients est une application populaire . En utilisant la classification, les entreprises dĂ©finissent des segments de clients pour interagir avec une base utilisateur potentielle. Elles divisent les clients en groupes selon des caractĂ©ristiques communes, comme le sexe, l'Ăąge, les intĂ©rĂȘts et les habitudes de dĂ©pense, afin de vendre efficacement leurs produits Ă chaque groupe. Nous utiliserons , ainsi que visualiser la rĂ©partition par sexe et Ăąge. Ensuite, nous analyserons leurs revenus annuels et leurs niveaux de dĂ©pense.
Langue : R
Jeu de données / Package : Ensemble de données Mall_Customers
13. Classification du cancer du sein
Voir la mise en Ćuvre complĂšte du projet Data Science en Python â .

En revenant à la contribution médicale de la science des données, apprenons à détecter le cancer du sein en utilisant Python. Nous allons utiliser le jeu de données IDC_regular pour identifier le carcinome canalaire invasif, la forme la plus courante de cancer du sein. Ce dernier se développe dans les canaux mammaires et pénÚtre dans le tissu fibreux ou adipeux du sein à l'extérieur du conduit. Dans cette idée de projet scientifique sur la collecte de données, nous allons utiliser et la bibliothÚque Keras pour la classification.
Langue : Python
Jeu de données / Package : IDC_regular
14. Reconnaissance des panneaux de signalisation (Traffic Signs Recognition)
Atteindre la précision dans la technologie de conduite autonome grùce à un projet de science des données sur open source.

Les panneaux de signalisation et le code de la route sont trĂšs importants pour chaque conducteur afin d'Ă©viter les accidents. Pour suivre la rĂšgle, il est d'abord nĂ©cessaire de comprendre Ă quoi ressemble un panneau de signalisation. Une personne doit apprendre tous les panneaux de signalisation avant qu'on ne lui accorde un permis pour conduire tout vĂ©hicule. Mais maintenant, le nombre de vĂ©hicules autonomes augmente, et dans un avenir proche, les gens ne conduiront plus eux-mĂȘmes leurs voitures. Dans le projet 'Reconnaissance des panneaux de signalisation', vous apprendrez comment un programme peut reconnaĂźtre le type de panneau de signalisation en prenant une image comme entrĂ©e. Le jeu de donnĂ©es de reconnaissance des panneaux de signalisation allemand (GTSRB) est utilisĂ© pour construire un rĂ©seau de neurones profond afin de reconnaĂźtre la classe Ă laquelle appartient le panneau. Nous crĂ©ons Ă©galement une interface graphique simple pour interagir avec l'application.
Langue : Python
Jeu de données : GTSRB (German Traffic Sign Recognition Benchmark)
Lire la suite
Source : habr.com
