Data Science per principianti
1. Analisi del Sentiment

Guarda l'implementazione completa del progetto Data Science utilizzando il codice sorgente — .
L'analisi del sentiment è l'analisi delle parole per determinare i sentimenti e le opinioni, che possono essere positivi o negativi. Questo è un tipo di classificazione in cui le classi possono essere binarie (positive e negative) o multiple (felici, arrabbiate, tristi, sgradevoli…). Realizzeremo questo progetto Data Science in R e utilizzeremo il dataset del pacchetto «janeaustenR». Utilizzeremo dizionari generali come AFINN, bing e loughran, eseguiremo un join interno, e alla fine creeremo una nuvola di parole per visualizzare il risultato.
Lingua: R
Dataset/Pacchetto: janeaustenR
L'articolo è stato tradotto con il supporto dell'azienda EDISON Software, che , e inoltre .
2. Rilevamento di Notizie False
Eleva le tue abilità a un nuovo livello lavorando su un progetto Data Science per principianti — .

Le notizie false sono informazioni false diffuse tramite social media e altri media online per scopi politici. In questa idea di progetto Data Science, utilizzeremo Python per costruire un modello in grado di determinare con precisione se una notizia è reale o falsa. Creeremo un TfidfVectorizer e utilizzeremo un PassiveAggressiveClassifier per classificare le notizie come 'reali' o 'falsi'. Utilizzeremo un dataset di dimensione 7796 × 4 e eseguiremo tutto in Jupyter Lab.
Lingua: Python
Dataset/Pacchetto: news.csv
3. Rilevamento della Malattia di Parkinson
Prosegui lavorando su un'idea di progetto Data Science — .

Abbiamo iniziato a utilizzare Data Science per migliorare la salute e i servizi — se riusciamo a prevedere la malattia in una fase precoce, avremo molti vantaggi. Quindi, in questa idea di progetto Data Science, impareremo a rilevare la malattia di Parkinson con Python. Questa è una malattia neurodegenerativa progressiva del sistema nervoso centrale che influisce sul movimento, causando tremori e rigidità. Colpisce i neuroni che producono dopamina nel cervello, e ogni anno coinvolge più di 1 milione di persone in India.
Lingua: Python
Dataset/Pacchetto: Dataset UCI ML Parkinsons
Progetti di Data Science di difficoltà media
4. Riconoscimento delle emozioni vocali
Scopri l'implementazione completa dell'esempio di progetto Data Science — .

Impariamo ora a utilizzare diverse librerie. Questo progetto di Data Science utilizza librosa per il riconoscimento vocale. SER è il processo di identificazione delle emozioni umane e degli stati affettivi tramite la voce. Poiché utilizziamo il tono e l'intonazione per esprimere emozioni vocali, il SER è rilevante. Ma poiché le emozioni sono soggettive, l'annotazione dell'audio è un compito complesso. Utilizzeremo le funzioni mfcc, chroma e mel e utilizzeremo il dataset RAVDESS per il riconoscimento delle emozioni. Creeremo un classificatore MLPC per questo modello.
Lingua: Python
Dataset/Pacchetto: Dataset RAVDESS
5. Riconoscimento del genere e dell'età
Colpisci i datori di lavoro con il più recente progetto di Data Science — .

Questo è un interessante progetto di Data Science con Python. Utilizzando solo un'immagine, imparerai a prevedere il genere e l'età di una persona. In questo progetto ti presenteremo la Computer Vision e i suoi principi. Costruiremo e utilizzeremo modelli addestrati da Tal Hassner e Gil Levi per il dataset Adience. Durante il percorso utilizzeremo alcuni file .pb, .pbtxt, .prototxt e .caffemodel.
Lingua: Python
Dataset/Pacchetto: Adience
6. Analisi dei dati di Uber
Guarda l'implementazione completa del progetto Data Science con codice sorgente — .

Questo è un progetto di visualizzazione dei dati con ggplot2, nel quale utilizzeremo R e le sue librerie per analizzare diversi parametri. Utilizzeremo il dataset Uber Pickups di New York e creeremo visualizzazioni per vari periodi dell'anno. Questo ci dice come il tempo influisce sugli spostamenti dei clienti.
Lingua: R
Dataset/Pacchetto: Dataset Uber Pickups a New York City
7. Rilevamento della sonnolenza del conducente
Migliora le tue abilità lavorando su un progetto di Data Science di alta qualità — .

Guidare stanco è estremamente pericoloso e ogni anno si verificano circa mille incidenti a causa di guidatori che si addormentano mentre guidano. In questo progetto in Python, creeremo un sistema in grado di rilevare i guidatori assonnati e di avvertirli con un segnale acustico.
Questo progetto è realizzato utilizzando Keras e OpenCV. Utilizzeremo OpenCV per il rilevamento di volti e occhi, mentre con Keras classificheremo lo stato dell'occhio (Aperto o Chiuso) utilizzando metodi di reti neurali profonde.
8. Chatbot
Crea un chatbot con Python e fai un passo avanti nella tua carriera — .

I chatbot sono una parte integrante del business. Molte aziende devono offrire servizi ai propri clienti, e per assisterli è necessaria molta manodopera, tempo e sforzi. I chatbot possono automatizzare gran parte delle interazioni con i clienti, rispondendo a alcune domande frequenti che gli utenti pongono. In generale, esistono due tipi di chatbot: specifici per dominio e open-domain. I chatbot specifici per dominio vengono spesso utilizzati per risolvere problemi specifici, quindi è necessario configurarli per funzionare in modo efficace nel proprio settore. I chatbot open-domain possono ricevere qualsiasi domanda, quindi per il loro addestramento è necessario un'enorme quantità di dati.
Set di dati: File json degli intenti
Lingua: Python
Progetti avanzati di Data Science
9. Generatore di descrizioni di immagini
Controlla l'implementazione completa del progetto con il codice sorgente — .

Descrivere cosa c'è in un'immagine è un compito facile per gli esseri umani, ma per i computer, un'immagine è semplicemente un insieme di numeri che rappresentano il valore del colore di ogni pixel. È un compito difficile per i computer. Comprendere cosa c'è in un'immagine e poi creare una descrizione in linguaggio naturale (ad esempio, in inglese) è un'altra sfida complessa. Questo progetto utilizza metodi di deep learning, in cui implementiamo una rete neurale convoluzionale (CNN) con una rete neurale ricorrente (LSTM) per creare un generatore di descrizioni di immagini.
Set di dati: Flickr 8K
Lingua: Python
Framework: Keras
10. Rilevamento delle frodi con carte di credito
Fai del tuo meglio lavorando su un'idea di progetto Data Science — .

Fino a questo punto hai iniziato a comprendere i metodi e i concetti. Passiamo ad alcuni progetti avanzati nel campo della scienza dei dati. In questo progetto utilizzeremo il linguaggio R con algoritmi come , regressione logistica, reti neurali artificiali e classificatore di boosting gradiente. Useremo un set di dati sulle transazioni con carte per classificare le transazioni delle carte di credito come fraudolente e autentiche. Adotteremo diversi modelli e costruiremo curve di performance.
Lingua: R
Dataset/Pacchetto: Set di dati sulle transazioni con carte
11. Sistema di Raccomandazione Cinematografica
Esplora l'implementazione del miglior progetto di Data Science con il codice sorgente —

In questo progetto di Data Science utilizzeremo R per effettuare raccomandazioni di film tramite machine learning. Il sistema di raccomandazione invia suggerimenti agli utenti attraverso un processo di filtraggio basato sulle preferenze di altri utenti e sulla cronologia delle visualizzazioni. Se ad A e B piace Mamma, ho preso il morbillo, e a B piace Mean Girls, allora possiamo suggerire a A che potrebbe piacerle anche. Ciò consente ai clienti di interagire con la piattaforma.
Lingua: R
Dataset/Pacchetto: Set di dati MovieLens
12. Segmentazione dei Clienti
Fai colpo sui datori di lavoro con un progetto di Data Science (incluso il codice sorgente) — .

La segmentazione dei clienti è un'applicazione popolare Utilizzando la clustering, le aziende identificano segmenti di clienti per lavorare su una potenziale base di utenti. Suddividono i clienti in gruppi in base a caratteristiche comuni, come genere, età, interessi e abitudini di spesa, in modo da poter vendere i loro prodotti in modo efficace a ciascun gruppo. Utilizzeremo , oltre a visualizzare la distribuzione per genere ed età. Analizzeremo poi i loro redditi annuali e livelli di spesa.
Lingua: R
Dataset/Pacchetto: Set di dati Mall_Customers
13. Classificazione del Cancro al Seno
Guarda l'implementazione completa del progetto di Data Science in Python — .

Tornando al contributo medico della scienza dei dati, impariamo a rilevare il cancro al seno utilizzando Python. Useremo il dataset IDC_regular per identificare il carcinoma duttale invasivo, la forma più comune di cancro al seno. Si sviluppa nei dotti mammari, penetrando nel tessuto fibroso o adiposo del seno dall'esterno del dotto. In questa idea di progetto scientifico di raccolta dati utilizzeremo e la libreria Keras per la classificazione.
Lingua: Python
Dataset/Pacchetto: IDC_regular
14. Riconoscimento dei segnali stradali
raggiungere un'accuratezza nella tecnologia di guida autonoma attraverso un progetto di Data Science per open source.

I segnali stradali e le norme stradali sono molto importanti per ogni conducente per evitare incidenti. Per seguire le regole, prima è necessario comprendere come appare un segnale stradale. Una persona deve memorizzare tutti i segnali stradali prima che le venga rilasciata la patente di guida per qualsiasi veicolo. Ma ora il numero di veicoli autonomi è in crescita e nel prossimo futuro una persona non guiderà più la macchina autonomamente. Nel progetto 'Riconoscimento dei segnali stradali', scoprirete come un programma può riconoscere il tipo di segnali stradali, prendendo un'immagine come input. Il dataset di riferimento per il riconoscimento dei segnali stradali in Germania (GTSRB) è utilizzato per costruire una rete neurale profonda per riconoscere la classe a cui appartiene il segnale stradale. Creiamo anche una semplice interfaccia grafica per interagire con l'applicazione.
Lingua: Python
Set di dati: GTSRB (German Traffic Sign Recognition Benchmark)
Leggi di più
Fonte: habr.com
