14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

Data Science pour débutants

1. Analyse des sentiments (Analyse des sentiments Ă  travers le texte)

14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

DĂ©couvrez l'implĂ©mentation complĂšte d'un projet Data Science avec le code source — Projet d'analyse des sentiments en R.

L'analyse des sentiments consiste Ă  examiner des mots pour dĂ©terminer les sentiments et opinions, qui peuvent ĂȘtre positifs ou nĂ©gatifs. C'est un type de classification oĂč les classes peuvent ĂȘtre binaires (positives et nĂ©gatives) ou multiples (heureux, en colĂšre, triste, dĂ©sagrĂ©able, 
). Nous allons rĂ©aliser ce projet Data Science en R et utiliser un jeu de donnĂ©es dans le package « janeaustenR ». Nous utiliserons des lexiques gĂ©nĂ©raux tels qu'AFINN, bing et loughran, effectuerons un joint interne, et Ă  la fin, nous crĂ©erons un nuage de mots pour visualiser le rĂ©sultat.

Langue : R
Jeu de données / Package : janeaustenR

14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

Cet article a été traduit avec le soutien de la société EDISON Software, qui crée des cabines d'essayage virtuelles pour des magasins multi-marques, ainsi que teste des logiciels.

2. Détection de Fake News (Détection de fausses nouvelles)

AmĂ©liorez vos compĂ©tences en travaillant sur un projet Data Science pour dĂ©butants — dĂ©tection de fausses nouvelles avec Python.

14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

Les fausses nouvelles sont des informations erronĂ©es diffusĂ©es via les rĂ©seaux sociaux et d'autres mĂ©dias en ligne dans un but politique. Dans cette idĂ©e de projet Data Science, nous allons utiliser Python pour construire un modĂšle capable de dĂ©terminer avec prĂ©cision si une nouvelle est rĂ©elle ou fausse. Nous crĂ©erons un TfidfVectorizer et utiliserons un PassiveAggressiveClassifier pour classifier les nouvelles en 'rĂ©elles' et 'fausses'. Nous utiliserons un jeu de donnĂ©es de forme 7796 × 4 et effectuerons tout cela dans Jupyter Lab.

Langue : Python

Jeu de données / Package : news.csv

3. Détection de la maladie de Parkinson (Détection de la maladie de Parkinson)

Avancez en travaillant sur l'idĂ©e du projet Data Science — dĂ©tection de la maladie de Parkinson avec XGBoost.

14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

Nous commençons Ă  utiliser le Data Science pour amĂ©liorer les soins de santĂ© et les services — si nous pouvons prĂ©dire la maladie Ă  un stade prĂ©coce, nous aurons de nombreux avantages. Ainsi, dans cette idĂ©e de projet Data Science, nous apprendrons Ă  dĂ©tecter la maladie de Parkinson avec Python. Il s'agit d'une maladie neurodĂ©gĂ©nĂ©rative progressive du systĂšme nerveux central qui impacte le mouvement et provoque des tremblements et de la rigiditĂ©. Elle affecte les neurones producteurs de dopamine dans le cerveau, et chaque annĂ©e, elle touche plus d'un million de personnes en Inde.

Langue : Python

Jeu de données / Package : Jeu de données UCI ML Parkinsons

Projets de science des données de complexité moyenne

4. Reconnaissance des émotions par la parole

DĂ©couvrez la mise en Ɠuvre complĂšte d'un projet de science des donnĂ©es — reconnaissance vocale Ă  l'aide de Librosa.

14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

Apprenons maintenant à utiliser différentes bibliothÚques. Ce projet de science des données utilise librosa pour la reconnaissance vocale. La reconnaissance des émotions par la parole (SER) est le processus de détermination des émotions humaines et des états affectifs à partir de la parole. Comme nous utilisons le ton et la hauteur pour exprimer des émotions vocales, le SER est pertinent. Cependant, étant donné que les émotions sont subjectives, l'annotation du son est une tùche complexe. Nous utiliserons les fonctions mfcc, chroma et mel et le jeu de données RAVDESS pour la reconnaissance des émotions. Nous créerons un classificateur MLPC pour ce modÚle.

Langue : Python

Jeu de données / Package : Jeu de données RAVDESS

5. Détection du sexe et de l'ùge

Impressionnez les employeurs avec le dernier projet de science des donnĂ©es — dĂ©tection du sexe et de l'Ăąge Ă  l'aide d'OpenCV.

14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

C'est un projet de science des données avec Python. En utilisant une seule image, vous apprendrez à prédire le sexe et l'ùge d'une personne. Dans ce projet, nous vous présenterons la vision par ordinateur et ses principes. Nous construirons un réseau de neurones convolutifs et utiliserons des modÚles formés par Tal Hassner et Gil Levi pour le jeu de données Adience. En cours de route, nous utiliserons certains fichiers .pb, .pbtxt, .prototxt et .caffemodel.

Langue : Python

Jeu de données / Package : Adience

6. Analyse des données Uber

DĂ©couvrez la mise en Ɠuvre complĂšte du projet de science des donnĂ©es avec le code source — Projet d'analyse des donnĂ©es Uber en R.

14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

C'est un projet de visualisation de donnĂ©es avec ggplot2, oĂč nous utiliserons R et ses bibliothĂšques pour analyser diffĂ©rents paramĂštres. Nous utiliserons le jeu de donnĂ©es Uber Pickups Ă  New York et crĂ©erons des visualisations pour diffĂ©rentes pĂ©riodes de l'annĂ©e. Cela nous indique comment le temps impacte les trajets des clients.

Langue : R

Jeu de données / Package : Jeu de données Uber Pickups à New York

7. Détection de la somnolence du conducteur

AmĂ©liorez vos compĂ©tences en travaillant sur le meilleur projet de science des donnĂ©es — systĂšme de dĂ©tection de somnolence avec OpenCV & Keras.

14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

La conduite somnolente est extrĂȘmement dangereuse et chaque annĂ©e, environ mille accidents se produisent Ă  cause des conducteurs qui s'endorment au volant. Dans ce projet en Python, nous crĂ©erons un systĂšme capable de dĂ©tecter les conducteurs somnolents et de les alerter avec un signal sonore.

Ce projet est rĂ©alisĂ© en utilisant Keras et OpenCV. Nous allons utiliser OpenCV pour dĂ©tecter le visage et les yeux, et avec Keras, nous allons classer l'Ă©tat de l'Ɠil (Ouvert ou FermĂ©) en utilisant des mĂ©thodes de rĂ©seau de neurones profonds.

8. Chatbot

CrĂ©ez un chatbot avec Python et faites un pas en avant dans votre carriĂšre — Chatbot avec NLTK & Keras.

14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

Les chatbots sont essentiels pour les entreprises. De nombreuses entreprises doivent offrir des services Ă  leurs clients, et cela nĂ©cessite beaucoup de main-d'Ɠuvre, de temps et d'efforts. Les chatbots peuvent automatiser une grande partie des interactions avec les clients, en rĂ©pondant Ă  certaines questions frĂ©quentes posĂ©es par ceux-ci. En gros, il existe deux types de chatbots : spĂ©cifiques au domaine et de domaine ouvert. Le chatbot spĂ©cifique au domaine est souvent utilisĂ© pour rĂ©soudre un problĂšme particulier. Ainsi, vous devez le configurer pour qu'il fonctionne efficacement dans votre domaine. Les chatbots de domaine ouvert peuvent recevoir toutes sortes de questions, donc leur apprentissage nĂ©cessite un Ă©norme volume de donnĂ©es.

Jeu de données : Fichier json d'intentions

Langue : Python

Projets avancés en Data Science

9. Générateur de légendes d'image

VĂ©rifiez la mise en Ɠuvre complĂšte du projet avec le code source — GĂ©nĂ©rateur de lĂ©gendes d'image avec CNN & LSTM.

14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

Décrire ce qui se trouve sur une image est une tùche facile pour les humains, mais pour les ordinateurs, une image est simplement une série de chiffres représentant la valeur de couleur de chaque pixel. C'est une tùche difficile pour les ordinateurs. Comprendre ce qu'il y a sur l'image et ensuite créer une description en langage naturel (par exemple, en anglais) est une autre tùche complexe. Ce projet utilise des méthodes d'apprentissage profond, dans lequel nous implémentons un Réseau de neurones convolutif (CNN) avec un Réseau de neurones récurrent (LSTM) pour créer un générateur de description d'image.

Jeu de données : Flickr 8K

Langue : Python

Cadre : Keras

10. Détection de fraude par carte de crédit

Faites de votre mieux en travaillant sur l'idĂ©e de projet Data Science — dĂ©tection de fraude par carte de crĂ©dit Ă  l'aide de l'apprentissage automatique.

14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

À ce stade, vous avez commencĂ© Ă  comprendre les mĂ©thodes et les concepts. Passons Ă  quelques projets avancĂ©s en science des donnĂ©es. Dans ce projet, nous allons utiliser le langage R avec des algorithmes tels que les arbres de dĂ©cision, rĂ©gression logistique, rĂ©seaux de neurones artificiels et classificateur de boosting par gradient. Nous utiliserons un ensemble de donnĂ©es sur les transactions par carte pour classifier les transactions de carte de crĂ©dit en tant que frauduleuses ou lĂ©gitimes. Nous sĂ©lectionnerons diffĂ©rents modĂšles pour cela et tracerons des courbes de performance.

Langue : R

Jeu de données / Package : Ensemble de données sur les transactions par carte

11. SystĂšme de recommandation de films

DĂ©couvrez la mise en Ɠuvre du meilleur projet de Data Science avec le code source — SystĂšme de recommandation de films en R

14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

Dans ce projet de Data Science, nous utiliserons R pour effectuer des recommandations de films par le biais de l'apprentissage machine. Le systĂšme de recommandation envoie des suggestions aux utilisateurs via un processus de filtrage basĂ© sur les prĂ©fĂ©rences d'autres utilisateurs et l'historique de visionnage. Si A et B aiment Maman, j'ai ratĂ© l'avion et que B aime Les filles du calendrier, alors on peut proposer Ă  A — cela pourrait aussi lui plaire. Cela permet aux clients d'interagir avec la plateforme.

Langue : R

Jeu de données / Package : Ensemble de données MovieLens

12. Segmentation des clients

Impressionnez les employeurs avec un projet de Data Science (incluant le code source) — Segmentation des clients par apprentissage machine.

14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

La segmentation des clients est une application populaire d'apprentissage non supervisĂ©. En utilisant la classification, les entreprises dĂ©finissent des segments de clients pour interagir avec une base utilisateur potentielle. Elles divisent les clients en groupes selon des caractĂ©ristiques communes, comme le sexe, l'Ăąge, les intĂ©rĂȘts et les habitudes de dĂ©pense, afin de vendre efficacement leurs produits Ă  chaque groupe. Nous utiliserons la classification K-means, ainsi que visualiser la rĂ©partition par sexe et Ăąge. Ensuite, nous analyserons leurs revenus annuels et leurs niveaux de dĂ©pense.

Langue : R

Jeu de données / Package : Ensemble de données Mall_Customers

13. Classification du cancer du sein

Voir la mise en Ɠuvre complùte du projet Data Science en Python — Classification du cancer du sein par apprentissage profond.

14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

En revenant à la contribution médicale de la science des données, apprenons à détecter le cancer du sein en utilisant Python. Nous allons utiliser le jeu de données IDC_regular pour identifier le carcinome canalaire invasif, la forme la plus courante de cancer du sein. Ce dernier se développe dans les canaux mammaires et pénÚtre dans le tissu fibreux ou adipeux du sein à l'extérieur du conduit. Dans cette idée de projet scientifique sur la collecte de données, nous allons utiliser Deep Learning et la bibliothÚque Keras pour la classification.

Langue : Python

Jeu de données / Package : IDC_regular

14. Reconnaissance des panneaux de signalisation (Traffic Signs Recognition)

Atteindre la précision dans la technologie de conduite autonome grùce à un projet de science des données sur la reconnaissance des panneaux de signalisation utilisant CNN open source.

14 projets open-source pour améliorer vos compétences en Data Science (facile, normal, difficile)

Les panneaux de signalisation et le code de la route sont trĂšs importants pour chaque conducteur afin d'Ă©viter les accidents. Pour suivre la rĂšgle, il est d'abord nĂ©cessaire de comprendre Ă  quoi ressemble un panneau de signalisation. Une personne doit apprendre tous les panneaux de signalisation avant qu'on ne lui accorde un permis pour conduire tout vĂ©hicule. Mais maintenant, le nombre de vĂ©hicules autonomes augmente, et dans un avenir proche, les gens ne conduiront plus eux-mĂȘmes leurs voitures. Dans le projet 'Reconnaissance des panneaux de signalisation', vous apprendrez comment un programme peut reconnaĂźtre le type de panneau de signalisation en prenant une image comme entrĂ©e. Le jeu de donnĂ©es de reconnaissance des panneaux de signalisation allemand (GTSRB) est utilisĂ© pour construire un rĂ©seau de neurones profond afin de reconnaĂźtre la classe Ă  laquelle appartient le panneau. Nous crĂ©ons Ă©galement une interface graphique simple pour interagir avec l'application.

Langue : Python

Jeu de données : GTSRB (German Traffic Sign Recognition Benchmark)

Lire la suite

Source : habr.com

Acheter un hĂ©bergement fiable pour les sites avec protection DDoS, serveurs VPS VDS đŸ”„ Acheter un hĂ©bergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster