Data Science per principianti
1. Analisi del Sentiment (Sentiment Analysis tramite testo)

Guarda l'implementazione completa del progetto Data Science utilizzando il codice sorgente — .
L'Analisi del Sentiment è l'analisi delle parole per determinare sentimenti e opinioni, che possono essere positivi o negativi. Si tratta di un tipo di classificazione, in cui le classi possono essere binarie (positive e negative) o multiple (felici, arrabbiate, tristi, sgradevoli ...). Implementeremo questo progetto di Data Science nel linguaggio R e utilizzeremo un insieme di dati dal pacchetto «janeaustenR». Utilizzeremo dizionari generali come AFINN, bing e loughran, eseguiremo join interni e alla fine creeremo una nuvola di parole per visualizzare il risultato.
Linguaggio: R
Insieme di dati/Pacchetto: janeaustenR
L'articolo è stato tradotto con il supporto di EDISON Software, che , così come .
2. Rilevamento di Fake News (Fake News Detection)
Porta le tue competenze a un livello superiore lavorando a un progetto Data Science per principianti — .

Le notizie false sono informazioni errate diffuse attraverso i social media e altri mezzi di comunicazione online per raggiungere obiettivi politici. In questa idea di progetto di Data Science, utilizzeremo Python per costruire un modello in grado di determinare con precisione se una notizia è vera o falsa. Creeremo un TfidfVectorizer e utilizzeremo un PassiveAggressiveClassifier per classificare le notizie in "vere" e "false". Useremo un dataset di dimensione 7796 × 4 e faremo tutto in Jupyter Lab.
Linguaggio: Python
Insieme di dati/Pacchetto: news.csv
3. Rilevazione della malattia di Parkinson
Avanza lavorando sull'idea del progetto di Data Science — .

Abbiamo iniziato a utilizzare la Data Science per migliorare la sanità e i servizi: se possiamo prevedere le malattie in fase precoce, possiamo ottenere molti vantaggi. Quindi, in questa idea di progetto di Data Science, impareremo a identificare la malattia di Parkinson utilizzando Python. Si tratta di una malattia neurodegenerativa progressiva del sistema nervoso centrale che influisce sul movimento e provoca tremori e rigidità. Essa colpisce i neuroni produttori di dopamina nel cervello e ogni anno tocca oltre 1 milione di persone in India.
Linguaggio: Python
Insieme di dati/Pacchetto: UCI ML Parkinsons dataset
Progetti di Data Science di media complessità
4. Speech Emotion Recognition
Scopri l'implementazione completa dell'esempio di progetto Data Science — .

Ora impariamo a utilizzare diverse librerie. Questo progetto di Data Science utilizza librosa per il riconoscimento vocale. SER è il processo di individuazione delle emozioni umane e degli stati affettivi attraverso la voce. Poiché utilizziamo il tono e l'intonazione per esprimere emozioni vocali, il SER è rilevante. Tuttavia, poiché le emozioni sono soggettive, l'annotazione del suono è un compito complesso. Useremo le funzioni mfcc, chroma e mel e utilizzeremo il dataset RAVDESS per il riconoscimento delle emozioni. Creeremo un classificatore MLPC per questo modello.
Linguaggio: Python
Insieme di dati/Pacchetto: RAVDESS dataset
5. Gender and Age Detection (Rilevamento del genere e dell'età)
Impressiona i datori di lavoro con il tuo ultimo progetto di Data Science — .

Questo è un interessante progetto di Data Science con Python. Utilizzando solo un'immagine, imparerai a prevedere il genere e l'età di una persona. In questo, ti introdurremo alla Computer Vision e ai suoi principi. Costruiremo e useremo modelli addestrati da Tal Hassner e Gil Levi per il dataset Adience. Durante il percorso utilizzeremo alcuni file .pb, .pbtxt, .prototxt e .caffemodel.
Linguaggio: Python
Insieme di dati/Pacchetto: Adience
6. Uber Data Analysis (Analisi dei dati Uber)
Scopri l'implementazione completa del progetto Data Science con codice sorgente — .

Questo è un progetto di visualizzazione dati con ggplot2, in cui utilizzeremo R e le sue librerie per analizzare vari parametri. Useremo il set di dati Uber Pickups a New York e creeremo visualizzazioni per diverse fasce orarie dell'anno. Questo ci informerà su come il tempo influenza i viaggi dei clienti.
Linguaggio: R
Insieme di dati/Pacchetto: set di dati Uber Pickups a New York City
7. Rilevamento della sonnolenza dei conducenti
Migliora le tue competenze lavorando su un Top Data Science Project — .

La guida assonnata è estremamente pericolosa, e ogni anno si verificano circa mille incidenti a causa di conducenti che si addormentano durante la guida. In questo progetto Python creeremo un sistema che potrà rilevare i conducenti assonnati e avvisarli con un segnale acustico.
Questo progetto è realizzato con Keras e OpenCV. Useremo OpenCV per rilevare il volto e gli occhi, mentre con Keras classificheremo lo stato dell'occhio (Aperto o Chiuso) utilizzando metodi di rete neurale profonda.
8. Chatbot
Crea un chatbot con Python e fai un passo avanti nella tua carriera — .

I chatbot sono una parte fondamentale del business. Molte aziende devono offrire servizi ai propri clienti, e per gestirli è necessario un notevole impegno di risorse umane, tempo e sforzi. I chatbot possono automatizzare gran parte delle interazioni con i clienti, rispondendo ad alcune delle domande più frequenti poste dai clienti. Esistono fondamentalmente due tipi di chatbot: specifici per dominio e a dominio aperto. I chatbot specifici per dominio sono spesso utilizzati per risolvere problemi specifici. Pertanto, è necessario configurarli per funzionare in modo efficace nel proprio settore. I chatbot a dominio aperto possono ricevere domande di qualsiasi tipo, quindi per il loro training è necessario un enorme quantità di dati.
Set di dati: File json degli intenti
Linguaggio: Python
Progetti avanzati di Data Science
9. Generatore di descrizioni delle immagini
Controlla l'implementazione completa del progetto con il codice sorgente — .

Descrivere ciò che è presente nell'immagine è un compito facile per le persone, ma per i computer, l'immagine è semplicemente un insieme di numeri che rappresentano il valore di colore di ciascun pixel. Comprendere cosa c'è nell'immagine e poi creare una descrizione in linguaggio naturale (ad esempio in inglese) è un'altra sfida complessa. Questo progetto utilizza metodi di deep learning in cui implementiamo una Rete Neurale Convoluzionale (CNN) con una Rete Neurale Ricorrente (LSTM) per generare descrizioni delle immagini.
Set di dati: Flickr 8K
Linguaggio: Python
Framework: Keras
10. Credit Card Fraud Detection
Fai del tuo meglio lavorando sull'idea del progetto Data Science — .

Fino ad ora hai iniziato a comprendere i metodi e i concetti. Passiamo ad alcuni progetti avanzati nel campo della scienza dei dati. In questo progetto utilizzeremo il linguaggio R con algoritmi come , regressione logistica, reti neurali artificiali e classificatore di gradient boosting. Utilizzeremo un dataset di transazioni con carte per classificare le transazioni delle carte di credito come fraudolente e genuine. Selezioneremo diversi modelli e costruiremo curve di prestazione.
Linguaggio: R
Insieme di dati/Pacchetto: Dataset sulle transazioni con carte
11. Sistema di Raccomandazione di Film
Scopri l'implementazione del miglior progetto Data Science con codice sorgente —

In questo progetto Data Science utilizzeremo R per effettuare raccomandazioni di film tramite machine learning. Il sistema di raccomandazione invia suggerimenti agli utenti attraverso un processo di filtraggio, basato sulle preferenze di altri utenti e sulla cronologia delle visualizzazioni. Se A e B amano Home Alone, e B ama Mean Girls, potremmo consigliare a A — potrebbero piacergli anche. Questo permette ai clienti di interagire con la piattaforma.
Linguaggio: R
Insieme di dati/Pacchetto: Dataset MovieLens
12. Segmentazione Clienti
Impressiona i datori di lavoro con un progetto Data Science (incluso codice sorgente) — .

La segmentazione dei clienti è un'applicazione popolare . Utilizzando la clustering, le aziende definiscono i segmenti di clientela per lavorare con un potenziale bacino di utenti. Dividono i clienti in gruppi in base a caratteristiche comuni, come sesso, età, interessi e abitudini di spesa, affinché possano vendere efficacemente i loro prodotti a ciascun gruppo. Utilizzeremo , e visualizzeremo quindi la distribuzione per sesso e età. Successivamente, analizzeremo i loro redditi annuali e il livello di spesa.
Linguaggio: R
Insieme di dati/Pacchetto: il dataset Mall_Customers
13. Classificazione del cancro al seno
Guarda l'implementazione completa del progetto Data Science in Python — .

Tornando al contributo della scienza dei dati in medicina, impariamo a rilevare il cancro al seno utilizzando Python. Useremo il set di dati IDC_regular per identificare il carcinoma duttale invasivo, la forma più comune di cancro al seno. Si sviluppa nei dotti mammari, penetrando nel tessuto fibroso o adiposo del seno al di fuori del dotto. In questa idea di progetto scientifico per la raccolta di dati, useremo e la libreria Keras per la classificazione.
Linguaggio: Python
Insieme di dati/Pacchetto: IDC_regular
14. Riconoscimento dei Segnali Stradali
Raggiungere precisione nella tecnologia di guida autonoma attraverso un progetto di Data Science per open source.

I segnali stradali e le norme del traffico sono fondamentali per ogni automobilista per evitare incidenti. Per rispettare la regola, è importante capire prima come appare un segnale stradale. È necessario che una persona impari tutti i segnali prima di ottenere la patente per guidare qualsiasi veicolo. Tuttavia, ora con l'aumento dei veicoli autonomi, in un futuro prossimo la gente non guiderà più da sola. Nel progetto "Riconoscimento dei segnali stradali" scoprirai come un programma può riconoscere il tipo di segnale stradale, utilizzando l'immagine come input. Il set di dati di riconoscimento dei segnali stradali tedeschi (GTSRB) è utilizzato per costruire una rete neurale profonda per riconoscere la classe a cui appartiene il segnale. Creeremo anche una semplice interfaccia grafica per interagire con l'applicazione.
Linguaggio: Python
Set di dati: GTSRB (German Traffic Sign Recognition Benchmark)
Leggi di più
Fonte: habr.com
