14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

Data Science per principianti

1. Analisi del Sentiment (Sentiment Analysis tramite testo)

14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

Guarda l'implementazione completa del progetto Data Science utilizzando il codice sorgente — Progetto di Analisi del Sentiment in R.

L'Analisi del Sentiment è l'analisi delle parole per determinare sentimenti e opinioni, che possono essere positivi o negativi. Si tratta di un tipo di classificazione, in cui le classi possono essere binarie (positive e negative) o multiple (felici, arrabbiate, tristi, sgradevoli ...). Implementeremo questo progetto di Data Science nel linguaggio R e utilizzeremo un insieme di dati dal pacchetto «janeaustenR». Utilizzeremo dizionari generali come AFINN, bing e loughran, eseguiremo join interni e alla fine creeremo una nuvola di parole per visualizzare il risultato.

Linguaggio: R
Insieme di dati/Pacchetto: janeaustenR

14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

L'articolo è stato tradotto con il supporto di EDISON Software, che crea camerini virtuali per negozi multi-brand., così come testa software..

2. Rilevamento di Fake News (Fake News Detection)

Porta le tue competenze a un livello superiore lavorando a un progetto Data Science per principianti — rilevamento di notizie false utilizzando Python.

14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

Le notizie false sono informazioni errate diffuse attraverso i social media e altri mezzi di comunicazione online per raggiungere obiettivi politici. In questa idea di progetto di Data Science, utilizzeremo Python per costruire un modello in grado di determinare con precisione se una notizia è vera o falsa. Creeremo un TfidfVectorizer e utilizzeremo un PassiveAggressiveClassifier per classificare le notizie in "vere" e "false". Useremo un dataset di dimensione 7796 × 4 e faremo tutto in Jupyter Lab.

Linguaggio: Python

Insieme di dati/Pacchetto: news.csv

3. Rilevazione della malattia di Parkinson

Avanza lavorando sull'idea del progetto di Data Science — rilevazione della malattia di Parkinson con XGBoost.

14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

Abbiamo iniziato a utilizzare la Data Science per migliorare la sanità e i servizi: se possiamo prevedere le malattie in fase precoce, possiamo ottenere molti vantaggi. Quindi, in questa idea di progetto di Data Science, impareremo a identificare la malattia di Parkinson utilizzando Python. Si tratta di una malattia neurodegenerativa progressiva del sistema nervoso centrale che influisce sul movimento e provoca tremori e rigidità. Essa colpisce i neuroni produttori di dopamina nel cervello e ogni anno tocca oltre 1 milione di persone in India.

Linguaggio: Python

Insieme di dati/Pacchetto: UCI ML Parkinsons dataset

Progetti di Data Science di media complessità

4. Speech Emotion Recognition

Scopri l'implementazione completa dell'esempio di progetto Data Science — riconoscimento vocale con Librosa.

14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

Ora impariamo a utilizzare diverse librerie. Questo progetto di Data Science utilizza librosa per il riconoscimento vocale. SER è il processo di individuazione delle emozioni umane e degli stati affettivi attraverso la voce. Poiché utilizziamo il tono e l'intonazione per esprimere emozioni vocali, il SER è rilevante. Tuttavia, poiché le emozioni sono soggettive, l'annotazione del suono è un compito complesso. Useremo le funzioni mfcc, chroma e mel e utilizzeremo il dataset RAVDESS per il riconoscimento delle emozioni. Creeremo un classificatore MLPC per questo modello.

Linguaggio: Python

Insieme di dati/Pacchetto: RAVDESS dataset

5. Gender and Age Detection (Rilevamento del genere e dell'età)

Impressiona i datori di lavoro con il tuo ultimo progetto di Data Science — rilevazione del genere e dell'età con OpenCV.

14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

Questo è un interessante progetto di Data Science con Python. Utilizzando solo un'immagine, imparerai a prevedere il genere e l'età di una persona. In questo, ti introdurremo alla Computer Vision e ai suoi principi. Costruiremo una rete neurale convoluzionale e useremo modelli addestrati da Tal Hassner e Gil Levi per il dataset Adience. Durante il percorso utilizzeremo alcuni file .pb, .pbtxt, .prototxt e .caffemodel.

Linguaggio: Python

Insieme di dati/Pacchetto: Adience

6. Uber Data Analysis (Analisi dei dati Uber)

Scopri l'implementazione completa del progetto Data Science con codice sorgente — Progetto di Analisi Uber in R.

14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

Questo è un progetto di visualizzazione dati con ggplot2, in cui utilizzeremo R e le sue librerie per analizzare vari parametri. Useremo il set di dati Uber Pickups a New York e creeremo visualizzazioni per diverse fasce orarie dell'anno. Questo ci informerà su come il tempo influenza i viaggi dei clienti.

Linguaggio: R

Insieme di dati/Pacchetto: set di dati Uber Pickups a New York City

7. Rilevamento della sonnolenza dei conducenti

Migliora le tue competenze lavorando su un Top Data Science Project — sistema di rilevamento della sonnolenza con OpenCV & Keras.

14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

La guida assonnata è estremamente pericolosa, e ogni anno si verificano circa mille incidenti a causa di conducenti che si addormentano durante la guida. In questo progetto Python creeremo un sistema che potrà rilevare i conducenti assonnati e avvisarli con un segnale acustico.

Questo progetto è realizzato con Keras e OpenCV. Useremo OpenCV per rilevare il volto e gli occhi, mentre con Keras classificheremo lo stato dell'occhio (Aperto o Chiuso) utilizzando metodi di rete neurale profonda.

8. Chatbot

Crea un chatbot con Python e fai un passo avanti nella tua carriera — Chatbot con NLTK & Keras.

14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

I chatbot sono una parte fondamentale del business. Molte aziende devono offrire servizi ai propri clienti, e per gestirli è necessario un notevole impegno di risorse umane, tempo e sforzi. I chatbot possono automatizzare gran parte delle interazioni con i clienti, rispondendo ad alcune delle domande più frequenti poste dai clienti. Esistono fondamentalmente due tipi di chatbot: specifici per dominio e a dominio aperto. I chatbot specifici per dominio sono spesso utilizzati per risolvere problemi specifici. Pertanto, è necessario configurarli per funzionare in modo efficace nel proprio settore. I chatbot a dominio aperto possono ricevere domande di qualsiasi tipo, quindi per il loro training è necessario un enorme quantità di dati.

Set di dati: File json degli intenti

Linguaggio: Python

Progetti avanzati di Data Science

9. Generatore di descrizioni delle immagini

Controlla l'implementazione completa del progetto con il codice sorgente — Generatore di descrizioni delle immagini con CNN & LSTM.

14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

Descrivere ciò che è presente nell'immagine è un compito facile per le persone, ma per i computer, l'immagine è semplicemente un insieme di numeri che rappresentano il valore di colore di ciascun pixel. Comprendere cosa c'è nell'immagine e poi creare una descrizione in linguaggio naturale (ad esempio in inglese) è un'altra sfida complessa. Questo progetto utilizza metodi di deep learning in cui implementiamo una Rete Neurale Convoluzionale (CNN) con una Rete Neurale Ricorrente (LSTM) per generare descrizioni delle immagini.

Set di dati: Flickr 8K

Linguaggio: Python

Framework: Keras

10. Credit Card Fraud Detection

Fai del tuo meglio lavorando sull'idea del progetto Data Science — rilevamento delle frodi con carta di credito tramite machine learning.

14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

Fino ad ora hai iniziato a comprendere i metodi e i concetti. Passiamo ad alcuni progetti avanzati nel campo della scienza dei dati. In questo progetto utilizzeremo il linguaggio R con algoritmi come gli alberi decisionali, regressione logistica, reti neurali artificiali e classificatore di gradient boosting. Utilizzeremo un dataset di transazioni con carte per classificare le transazioni delle carte di credito come fraudolente e genuine. Selezioneremo diversi modelli e costruiremo curve di prestazione.

Linguaggio: R

Insieme di dati/Pacchetto: Dataset sulle transazioni con carte

11. Sistema di Raccomandazione di Film

Scopri l'implementazione del miglior progetto Data Science con codice sorgente — Sistema di Raccomandazione di Film in R

14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

In questo progetto Data Science utilizzeremo R per effettuare raccomandazioni di film tramite machine learning. Il sistema di raccomandazione invia suggerimenti agli utenti attraverso un processo di filtraggio, basato sulle preferenze di altri utenti e sulla cronologia delle visualizzazioni. Se A e B amano Home Alone, e B ama Mean Girls, potremmo consigliare a A — potrebbero piacergli anche. Questo permette ai clienti di interagire con la piattaforma.

Linguaggio: R

Insieme di dati/Pacchetto: Dataset MovieLens

12. Segmentazione Clienti

Impressiona i datori di lavoro con un progetto Data Science (incluso codice sorgente) — Segmentazione dei clienti tramite machine learning.

14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

La segmentazione dei clienti è un'applicazione popolare del machine learning non supervisionato. Utilizzando la clustering, le aziende definiscono i segmenti di clientela per lavorare con un potenziale bacino di utenti. Dividono i clienti in gruppi in base a caratteristiche comuni, come sesso, età, interessi e abitudini di spesa, affinché possano vendere efficacemente i loro prodotti a ciascun gruppo. Utilizzeremo il clustering K-means, e visualizzeremo quindi la distribuzione per sesso e età. Successivamente, analizzeremo i loro redditi annuali e il livello di spesa.

Linguaggio: R

Insieme di dati/Pacchetto: il dataset Mall_Customers

13. Classificazione del cancro al seno

Guarda l'implementazione completa del progetto Data Science in Python — Classificazione del cancro al seno tramite deep learning.

14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

Tornando al contributo della scienza dei dati in medicina, impariamo a rilevare il cancro al seno utilizzando Python. Useremo il set di dati IDC_regular per identificare il carcinoma duttale invasivo, la forma più comune di cancro al seno. Si sviluppa nei dotti mammari, penetrando nel tessuto fibroso o adiposo del seno al di fuori del dotto. In questa idea di progetto scientifico per la raccolta di dati, useremo Deep Learning e la libreria Keras per la classificazione.

Linguaggio: Python

Insieme di dati/Pacchetto: IDC_regular

14. Riconoscimento dei Segnali Stradali

Raggiungere precisione nella tecnologia di guida autonoma attraverso un progetto di Data Science per il riconoscimento dei segnali stradali utilizzando CNN open source.

14 progetti open-source per potenziare le competenze in Data Science (facile, normale, difficile)

I segnali stradali e le norme del traffico sono fondamentali per ogni automobilista per evitare incidenti. Per rispettare la regola, è importante capire prima come appare un segnale stradale. È necessario che una persona impari tutti i segnali prima di ottenere la patente per guidare qualsiasi veicolo. Tuttavia, ora con l'aumento dei veicoli autonomi, in un futuro prossimo la gente non guiderà più da sola. Nel progetto "Riconoscimento dei segnali stradali" scoprirai come un programma può riconoscere il tipo di segnale stradale, utilizzando l'immagine come input. Il set di dati di riconoscimento dei segnali stradali tedeschi (GTSRB) è utilizzato per costruire una rete neurale profonda per riconoscere la classe a cui appartiene il segnale. Creeremo anche una semplice interfaccia grafica per interagire con l'applicazione.

Linguaggio: Python

Set di dati: GTSRB (German Traffic Sign Recognition Benchmark)

Leggi di più

Fonte: habr.com

Acquista hosting affidabile per siti web con protezione DDoS, server VPS VDS 🔥 Acquista hosting affidabile per siti web con protezione DDoS, server VPS VDS | ProHoster