14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

Data Science per principianti

1. Analisi del Sentiment

14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

Guarda l'implementazione completa del progetto Data Science utilizzando il codice sorgente — Progetto di Analisi del Sentiment in R.

L'analisi del sentiment è l'analisi delle parole per determinare i sentimenti e le opinioni, che possono essere positivi o negativi. Questo è un tipo di classificazione in cui le classi possono essere binarie (positive e negative) o multiple (felici, arrabbiate, tristi, sgradevoli…). Realizzeremo questo progetto Data Science in R e utilizzeremo il dataset del pacchetto «janeaustenR». Utilizzeremo dizionari generali come AFINN, bing e loughran, eseguiremo un join interno, e alla fine creeremo una nuvola di parole per visualizzare il risultato.

Lingua: R
Dataset/Pacchetto: janeaustenR

14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

L'articolo è stato tradotto con il supporto dell'azienda EDISON Software, che crea camerini virtuali per negozi multimarca, e inoltre testa il software.

2. Rilevamento di Notizie False

Eleva le tue abilità a un nuovo livello lavorando su un progetto Data Science per principianti — rilevamento di notizie false con Python.

14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

Le notizie false sono informazioni false diffuse tramite social media e altri media online per scopi politici. In questa idea di progetto Data Science, utilizzeremo Python per costruire un modello in grado di determinare con precisione se una notizia è reale o falsa. Creeremo un TfidfVectorizer e utilizzeremo un PassiveAggressiveClassifier per classificare le notizie come 'reali' o 'falsi'. Utilizzeremo un dataset di dimensione 7796 × 4 e eseguiremo tutto in Jupyter Lab.

Lingua: Python

Dataset/Pacchetto: news.csv

3. Rilevamento della Malattia di Parkinson

Prosegui lavorando su un'idea di progetto Data Science — rilevamento della malattia di Parkinson con XGBoost.

14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

Abbiamo iniziato a utilizzare Data Science per migliorare la salute e i servizi — se riusciamo a prevedere la malattia in una fase precoce, avremo molti vantaggi. Quindi, in questa idea di progetto Data Science, impareremo a rilevare la malattia di Parkinson con Python. Questa è una malattia neurodegenerativa progressiva del sistema nervoso centrale che influisce sul movimento, causando tremori e rigidità. Colpisce i neuroni che producono dopamina nel cervello, e ogni anno coinvolge più di 1 milione di persone in India.

Lingua: Python

Dataset/Pacchetto: Dataset UCI ML Parkinsons

Progetti di Data Science di difficoltà media

4. Riconoscimento delle emozioni vocali

Scopri l'implementazione completa dell'esempio di progetto Data Science — riconoscimento vocale utilizzando Librosa.

14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

Impariamo ora a utilizzare diverse librerie. Questo progetto di Data Science utilizza librosa per il riconoscimento vocale. SER è il processo di identificazione delle emozioni umane e degli stati affettivi tramite la voce. Poiché utilizziamo il tono e l'intonazione per esprimere emozioni vocali, il SER è rilevante. Ma poiché le emozioni sono soggettive, l'annotazione dell'audio è un compito complesso. Utilizzeremo le funzioni mfcc, chroma e mel e utilizzeremo il dataset RAVDESS per il riconoscimento delle emozioni. Creeremo un classificatore MLPC per questo modello.

Lingua: Python

Dataset/Pacchetto: Dataset RAVDESS

5. Riconoscimento del genere e dell'età

Colpisci i datori di lavoro con il più recente progetto di Data Science — determinazione del genere e dell'età utilizzando OpenCV.

14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

Questo è un interessante progetto di Data Science con Python. Utilizzando solo un'immagine, imparerai a prevedere il genere e l'età di una persona. In questo progetto ti presenteremo la Computer Vision e i suoi principi. Costruiremo una rete neurale convoluzionale e utilizzeremo modelli addestrati da Tal Hassner e Gil Levi per il dataset Adience. Durante il percorso utilizzeremo alcuni file .pb, .pbtxt, .prototxt e .caffemodel.

Lingua: Python

Dataset/Pacchetto: Adience

6. Analisi dei dati di Uber

Guarda l'implementazione completa del progetto Data Science con codice sorgente — Progetto di Analisi dei Dati di Uber in R.

14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

Questo è un progetto di visualizzazione dei dati con ggplot2, nel quale utilizzeremo R e le sue librerie per analizzare diversi parametri. Utilizzeremo il dataset Uber Pickups di New York e creeremo visualizzazioni per vari periodi dell'anno. Questo ci dice come il tempo influisce sugli spostamenti dei clienti.

Lingua: R

Dataset/Pacchetto: Dataset Uber Pickups a New York City

7. Rilevamento della sonnolenza del conducente

Migliora le tue abilità lavorando su un progetto di Data Science di alta qualità — sistema di rilevamento della sonnolenza con OpenCV e Keras.

14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

Guidare stanco è estremamente pericoloso e ogni anno si verificano circa mille incidenti a causa di guidatori che si addormentano mentre guidano. In questo progetto in Python, creeremo un sistema in grado di rilevare i guidatori assonnati e di avvertirli con un segnale acustico.

Questo progetto è realizzato utilizzando Keras e OpenCV. Utilizzeremo OpenCV per il rilevamento di volti e occhi, mentre con Keras classificheremo lo stato dell'occhio (Aperto o Chiuso) utilizzando metodi di reti neurali profonde.

8. Chatbot

Crea un chatbot con Python e fai un passo avanti nella tua carriera — Chatbot con NLTK & Keras.

14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

I chatbot sono una parte integrante del business. Molte aziende devono offrire servizi ai propri clienti, e per assisterli è necessaria molta manodopera, tempo e sforzi. I chatbot possono automatizzare gran parte delle interazioni con i clienti, rispondendo a alcune domande frequenti che gli utenti pongono. In generale, esistono due tipi di chatbot: specifici per dominio e open-domain. I chatbot specifici per dominio vengono spesso utilizzati per risolvere problemi specifici, quindi è necessario configurarli per funzionare in modo efficace nel proprio settore. I chatbot open-domain possono ricevere qualsiasi domanda, quindi per il loro addestramento è necessario un'enorme quantità di dati.

Set di dati: File json degli intenti

Lingua: Python

Progetti avanzati di Data Science

9. Generatore di descrizioni di immagini

Controlla l'implementazione completa del progetto con il codice sorgente — Generatore di descrizione immagini con CNN & LSTM.

14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

Descrivere cosa c'è in un'immagine è un compito facile per gli esseri umani, ma per i computer, un'immagine è semplicemente un insieme di numeri che rappresentano il valore del colore di ogni pixel. È un compito difficile per i computer. Comprendere cosa c'è in un'immagine e poi creare una descrizione in linguaggio naturale (ad esempio, in inglese) è un'altra sfida complessa. Questo progetto utilizza metodi di deep learning, in cui implementiamo una rete neurale convoluzionale (CNN) con una rete neurale ricorrente (LSTM) per creare un generatore di descrizioni di immagini.

Set di dati: Flickr 8K

Lingua: Python

Framework: Keras

10. Rilevamento delle frodi con carte di credito

Fai del tuo meglio lavorando su un'idea di progetto Data Science — rilevamento delle frodi con carte di credito tramite machine learning.

14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

Fino a questo punto hai iniziato a comprendere i metodi e i concetti. Passiamo ad alcuni progetti avanzati nel campo della scienza dei dati. In questo progetto utilizzeremo il linguaggio R con algoritmi come gli alberi decisionali, regressione logistica, reti neurali artificiali e classificatore di boosting gradiente. Useremo un set di dati sulle transazioni con carte per classificare le transazioni delle carte di credito come fraudolente e autentiche. Adotteremo diversi modelli e costruiremo curve di performance.

Lingua: R

Dataset/Pacchetto: Set di dati sulle transazioni con carte

11. Sistema di Raccomandazione Cinematografica

Esplora l'implementazione del miglior progetto di Data Science con il codice sorgente — Sistema di Raccomandazione Cinematografica in R

14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

In questo progetto di Data Science utilizzeremo R per effettuare raccomandazioni di film tramite machine learning. Il sistema di raccomandazione invia suggerimenti agli utenti attraverso un processo di filtraggio basato sulle preferenze di altri utenti e sulla cronologia delle visualizzazioni. Se ad A e B piace Mamma, ho preso il morbillo, e a B piace Mean Girls, allora possiamo suggerire a A che potrebbe piacerle anche. Ciò consente ai clienti di interagire con la piattaforma.

Lingua: R

Dataset/Pacchetto: Set di dati MovieLens

12. Segmentazione dei Clienti

Fai colpo sui datori di lavoro con un progetto di Data Science (incluso il codice sorgente) — Segmentazione dei clienti tramite machine learning.

14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

La segmentazione dei clienti è un'applicazione popolare di apprendimento non supervisionato.Utilizzando la clustering, le aziende identificano segmenti di clienti per lavorare su una potenziale base di utenti. Suddividono i clienti in gruppi in base a caratteristiche comuni, come genere, età, interessi e abitudini di spesa, in modo da poter vendere i loro prodotti in modo efficace a ciascun gruppo. Utilizzeremo la clustering K-means, oltre a visualizzare la distribuzione per genere ed età. Analizzeremo poi i loro redditi annuali e livelli di spesa.

Lingua: R

Dataset/Pacchetto: Set di dati Mall_Customers

13. Classificazione del Cancro al Seno

Guarda l'implementazione completa del progetto di Data Science in Python — Classificazione del cancro al seno tramite deep learning.

14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

Tornando al contributo medico della scienza dei dati, impariamo a rilevare il cancro al seno utilizzando Python. Useremo il dataset IDC_regular per identificare il carcinoma duttale invasivo, la forma più comune di cancro al seno. Si sviluppa nei dotti mammari, penetrando nel tessuto fibroso o adiposo del seno dall'esterno del dotto. In questa idea di progetto scientifico di raccolta dati utilizzeremo Deep Learning e la libreria Keras per la classificazione.

Lingua: Python

Dataset/Pacchetto: IDC_regular

14. Riconoscimento dei segnali stradali

raggiungere un'accuratezza nella tecnologia di guida autonoma attraverso un progetto di Data Science per il riconoscimento dei segnali stradali utilizzando CNN open source.

14 progetti open-source per migliorare le competenze in Data Science (facile, normale, difficile)

I segnali stradali e le norme stradali sono molto importanti per ogni conducente per evitare incidenti. Per seguire le regole, prima è necessario comprendere come appare un segnale stradale. Una persona deve memorizzare tutti i segnali stradali prima che le venga rilasciata la patente di guida per qualsiasi veicolo. Ma ora il numero di veicoli autonomi è in crescita e nel prossimo futuro una persona non guiderà più la macchina autonomamente. Nel progetto 'Riconoscimento dei segnali stradali', scoprirete come un programma può riconoscere il tipo di segnali stradali, prendendo un'immagine come input. Il dataset di riferimento per il riconoscimento dei segnali stradali in Germania (GTSRB) è utilizzato per costruire una rete neurale profonda per riconoscere la classe a cui appartiene il segnale stradale. Creiamo anche una semplice interfaccia grafica per interagire con l'applicazione.

Lingua: Python

Set di dati: GTSRB (German Traffic Sign Recognition Benchmark)

Leggi di più

Fonte: habr.com

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster