14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

Data Science fĂŒr AnfĂ€nger

1. Sentiment-Analyse (Stimmungsanalyse durch Text)

14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

Sehen Sie sich die vollstĂ€ndige Umsetzung des Data Science-Projekts mit Quellcode an — Sentiment-Analyse-Projekt in R.

Sentiment-Analyse ist die Analyse von Wörtern zur Bestimmung von Stimmungen und Meinungen, die positiv oder negativ sein können. Es ist eine Art von Klassifikation, bei der die Klassen binĂ€r (positiv und negativ) oder mehrfach (glĂŒcklich, wĂŒtend, traurig, unangenehm ...) sein können. Wir setzen dieses Data Science-Projekt in der Programmiersprache R um und verwenden einen Datensatz aus dem Paket „janeaustenR“. Wir verwenden allgemeine WörterbĂŒcher wie AFINN, bing und loughran, fĂŒhren innere VerknĂŒpfungen durch und am Ende erstellen wir eine Wortwolke, um das Ergebnis darzustellen.

Sprache: R
Datensatz/Paket: janeaustenR

14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

Der Artikel wurde mit UnterstĂŒtzung der Firma EDISON Software ĂŒbersetzt, die macht virtuelle Umkleidekabinen fĂŒr Multibrand-Shops, sowie testet Software.

2. Fake News Detection (Erkennung von Fake News)

Heben Sie Ihre FĂ€higkeiten auf die nĂ€chste Stufe, indem Sie an einem Data Science-Projekt fĂŒr AnfĂ€nger arbeiten — Erkennung von gefĂ€lschten Nachrichten mit Python.

14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

Fake News sind falsche Informationen, die ĂŒber soziale Netzwerke und andere Online-Medien verbreitet werden, um politische Ziele zu verfolgen. In dieser Projektidee im Bereich Data Science verwenden wir Python, um ein Modell zu erstellen, das genau bestimmen kann, ob eine Nachricht echt oder falsch ist. Wir erstellen einen TfidfVectorizer und verwenden einen PassiveAggressiveClassifier, um Nachrichten in „echt“ und „falsch“ zu klassifizieren. Wir nutzen einen Datensatz mit der Form 7796 × 4 und fĂŒhren alles im Jupyter Lab aus.

Sprache: Python

Datensatz/Paket: news.csv

3. Detecting Parkinson’s Disease (Erkennung von Parkinson-Krankheit)

Vorankommen, indem Sie an der Projektidee Data Science Project Idea arbeiten — Erkennung von Parkinson-Krankheit mit XGBoost.

14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

Wir haben begonnen, Data Science zur Verbesserung des Gesundheitswesens und der Dienstleistungen einzusetzen — wenn wir Krankheiten frĂŒhzeitig vorhersagen können, haben wir viele Vorteile. In dieser Projektidee im Bereich Data Science lernen wir, wie man die Parkinson-Krankheit mit Python erkennt. Es handelt sich um eine neurodegenerative, fortschreitende Erkrankung des zentralen Nervensystems, die sich auf die Bewegung auswirkt und Zittern und Steifheit verursacht. Sie beeintrĂ€chtigt die Dopamin-produzierenden Neuronen im Gehirn, und jedes Jahr sind mehr als 1 Million Menschen in Indien betroffen.

Sprache: Python

Datensatz/Paket: UCI ML Parkinsons-Datensatz

Data Science Projekte mittlerer KomplexitÀt

4. Spracherkennung von Emotionen

Erfahren Sie mehr ĂŒber die vollstĂ€ndige Umsetzung des Data Science-Projekts — Spracherkennung mit Librosa.

14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

Lernen wir nun, verschiedene Bibliotheken zu verwenden. Dieses Data Science-Projekt nutzt librosa zur Spracherkennung. SER ist der Prozess, menschliche Emotionen und affektive ZustĂ€nde durch Sprache zu bestimmen. Da wir Ton und Tonhöhe zur Ausdruck von Emotionen verwenden, ist SER relevant. Aber da Emotionen subjektiv sind, ist die Annotation von Ton sehr herausfordernd. Wir werden die Funktionen mfcc, chroma und mel verwenden und den RAVDESS-Datensatz zur Emotionserkennung nutzen. Wir erstellen einen MLPC-Klassifikator fĂŒr dieses Modell.

Sprache: Python

Datensatz/Paket: RAVDESS-Datensatz

5. Geschlechts- und Altersbestimmung

Beeindrucken Sie Arbeitgeber mit dem neuesten Data Science-Projekt — Geschlecht und Alter mit OpenCV bestimmen.

14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

Dies ist ein interessantes Data Science-Projekt mit Python. Anhand eines einzigen Bildes lernen Sie, das Geschlecht und das Alter einer Person vorherzusagen. Dabei fĂŒhren wir Sie in die Computer Vision und deren Prinzipien ein. Wir werden eine faltungsneuronale Netzwerk verwenden und die Modelle, die von Tal Hassner und Gil Levi fĂŒr den Adience-Datensatz trainiert wurden. Unterwegs verwenden wir einige .pb, .pbtxt, .prototxt und .caffemodel-Dateien.

Sprache: Python

Datensatz/Paket: Adience

6. Uber-Datenanalyse

Sehen Sie sich die vollstĂ€ndige Umsetzung des Data Science-Projekts mit Quellcode an — Uber-Datenanalyseprojekt in R.

14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

Dies ist ein Datenvisualisierungsprojekt mit ggplot2, bei dem wir R und seine Bibliotheken verwenden werden, um verschiedene Parameter zu analysieren. Wir werden den Datensatz Uber Pickups in New York nutzen und Visualisierungen fĂŒr verschiedene Zeitrahmen des Jahres erstellen. Dies zeigt uns, wie die Zeit die Fahrten der Kunden beeinflusst.

Sprache: R

Datensatz/Paket: Uber Pickups in New York City-Datensatz

7. Erkennung von FahrermĂŒdigkeit

Verbessern Sie Ihre FĂ€higkeiten, indem Sie an einem der besten Data Science-Projekte arbeiten — System zur Erkennung von MĂŒdigkeit mit OpenCV & Keras.

14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

MĂŒdes Fahren ist extrem gefĂ€hrlich und jedes Jahr passieren etwa tausend UnfĂ€lle, weil Fahrer wĂ€hrend der Fahrt einschlafen. In diesem Python-Projekt werden wir ein System erstellen, das mĂŒde Fahrer erkennt und sie akustisch warnt.

Dieses Projekt wurde mit Keras und OpenCV umgesetzt. Wir werden OpenCV zur Gesichtserkennung und zur Erkennung von Augen verwenden, wÀhrend wir mit Keras den Zustand des Auges (Offen oder Geschlossen) mithilfe von Methoden des tiefen neuronalen Netzes klassifizieren werden.

8. Chatbot

Erstellen Sie einen Chatbot mit Python und machen Sie einen Schritt nach vorne in Ihrer Karriere — Chatbot mit NLTK & Keras.

14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

Chatbots sind ein wesentlicher Bestandteil von Unternehmen. Viele Unternehmen mĂŒssen Dienstleistungen fĂŒr ihre Kunden anbieten, was viel Personal, Zeit und Aufwand erfordert. Chatbots können einen großen Teil der Kundeninteraktion automatisieren, indem sie auf hĂ€ufige Fragen Antworten geben, die von Kunden gestellt werden. Es gibt hauptsĂ€chlich zwei Arten von Chatbots: DomĂ€nenspezifische und Offene DomĂ€nen. DomĂ€nenspezifische Chatbots werden oft eingesetzt, um spezifische Probleme zu lösen. Daher mĂŒssen Sie sie anpassen, damit sie in Ihrem Bereich effektiv arbeiten. Offene DomĂ€nen-Chatbots können auf beliebige Fragen Antworten geben, weshalb eine große Menge an Daten benötigt wird, um sie zu trainieren.

Datensatz: Intents JSON-Datei

Sprache: Python

Fortgeschrittene Data Science Projekte

9. Bildbeschreibungs-Generator

ÜberprĂŒfen Sie die vollstĂ€ndige Implementierung des Projekts mit Quellcode — Bildbeschreibungs-Generator mit CNN & LSTM.

14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

Die Beschreibung dessen, was auf einem Bild zu sehen ist, ist fĂŒr Menschen eine einfache Aufgabe, aber fĂŒr Computer ist ein Bild einfach eine Reihe von Zahlen, die den Farbwert jedes Pixels darstellen. Es ist eine schwierige Aufgabe fĂŒr Computer. Zu verstehen, was sich in einem Bild befindet, und dann eine Beschreibung in natĂŒrlicher Sprache zu erstellen (zum Beispiel auf Englisch) ist eine weitere schwierige Aufgabe. Dieses Projekt nutzt Methoden des tiefen Lernens, bei denen wir ein Convolutional Neural Network (CNN) mit einem Recurrent Neural Network (LSTM) implementieren, um einen Bildbeschreibungs-Generator zu erstellen.

Datensatz: Flickr 8K

Sprache: Python

Framework: Keras

10. Betrugserkennung bei Kreditkarten

Geben Sie Ihr Bestes, wĂ€hrend Sie an einer Data Science Projektidee arbeiten — Betrugserkennung bei Kreditkarten mit maschinellem Lernen.

14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

Bis jetzt haben Sie begonnen, die Methoden und Konzepte zu verstehen. Lassen Sie uns zu einigen fortgeschrittenen Projekten im Bereich Data Science ĂŒbergehen. In diesem Projekt werden wir die Sprache R mit Algorithmen wie EntscheidungsbĂ€ume verwenden, logistische Regression, kĂŒnstliche neuronale Netze und Gradientenboosting-Klassifikator. Wir werden einen Datensatz von Kreditkartenoperationen nutzen, um Transaktionen als betrĂŒgerisch oder echt zu klassifizieren. Wir werden verschiedene Modelle auswĂ€hlen und Leistungsdiagramme erstellen.

Sprache: R

Datensatz/Paket: Datensatz der Kreditkartentransaktionen

11. Filmempfehlungssystem

Erforschen Sie die Implementierung eines der besten Data-Science-Projekte mit Quellcode — Filmempfehlungssystem in R

14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

In diesem Data-Science-Projekt werden wir R verwenden, um Filmempfehlungen mithilfe von maschinellem Lernen durchzufĂŒhren. Das Empfehlungssystem unterbreitet den Nutzern VorschlĂ€ge durch einen Filterprozess, der auf den Vorlieben anderer Nutzer und der Geschichte ihrer Ansehen basiert. Wenn A und B „Kevin – Allein zu Hause“ mögen und B „Girls Club – Vorsicht bissig“ liebt, dann könnte man A empfehlen, es ebenfalls zu probieren. Dadurch können sich die Kunden mit der Plattform beschĂ€ftigen.

Sprache: R

Datensatz/Paket: MovieLens-Datensatz

12. Kundensegmentierung

Beeindrucken Sie Arbeitgeber mit einem Data-Science-Projekt (einschließlich Quellcode) — Kundensegmentierung mittels maschinellen Lernens.

14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

Die Segmentierung von KĂ€ufern ist eine beliebte Anwendung des unĂŒberwachten Lernens.Durch Clusterbildung identifizieren Unternehmen Kundensegmente, um mit potenziellen Nutzerbasen zu arbeiten. Sie teilen Kunden in Gruppen basierend auf gemeinsamen Merkmalen wie Geschlecht, Alter, Interessen und Ausgabeverhalten ein, damit sie ihre Produkte effektiv an jede Gruppe verkaufen können. Wir werden verwenden K-Means-Clustering, sowie die Verteilung nach Geschlecht und Alter visualisieren. Danach analysieren wir ihr Jahreseinkommen und Ausgabenverhalten.

Sprache: R

Datensatz/Paket: Mall_Customers-Datensatz

13. Brustkrebs-Klassifizierung

Sehen Sie sich die vollstĂ€ndige Implementierung des Data-Science-Projekts in Python an — Klassifizierung von Brustkrebs mit Deep Learning.

14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

Kehren wir zum medizinischen Beitrag der Datenwissenschaft zurĂŒck, lassen Sie uns lernen, Brustkrebs mit Python zu identifizieren. Wir werden den Datensatz IDC_regular verwenden, um invasive Duktuskarzinome zu identifizieren, die hĂ€ufigste Form von Brustkrebs. Es entwickelt sich in den MilchgĂ€ngen und dringt in das faserige oder fettige Gewebe der Brust außerhalb des Ganges ein. In dieser wissenschaftlichen Projektidee zur Datensammlung werden wir nutzen Deep Learning und die Keras-Bibliothek zur Klassifizierung.

Sprache: Python

Datensatz/Paket: IDC_regular

14. Verkehrsschilderkennung

Die Genauigkeit in der Technologie des autonomen Fahrens mit einem Data-Science-Projekt zur Erkennung von Verkehrsschildern unter Verwendung von CNN mit Open Source.

14 Open-Source-Projekte zur Verbesserung der Data Science FĂ€higkeiten (einfach, normal, schwer)

Verkehrsschilder und Verkehrsregeln sind fĂŒr jeden Fahrer sehr wichtig, um UnfĂ€lle zu vermeiden. Um eine Regel zu befolgen, muss man zunĂ€chst verstehen, wie ein Verkehrsschild aussieht. Eine Person muss alle Verkehrsschilder lernen, bevor sie den FĂŒhrerschein fĂŒr ŰŁÙŠ Transportmittel erhĂ€lt. Aber jetzt nimmt die Zahl der autonomen Fahrzeuge zu, und in naher Zukunft wird der Mensch das Auto nicht mehr selbst fahren. In dem Projekt „Verkehrsschilderkennung“ werden Sie lernen, wie ein Programm die Art der Verkehrsschilder erkennen kann, indem es ein Bild als Eingabesignal nimmt. Der deutsche Datensatz fĂŒr die Verkehrsschilderkennung (GTSRB) wird verwendet, um ein tiefes neuronales Netzwerk zur Erkennung der Klasse, zu der das Verkehrsschild gehört, zu erstellen. Wir erstellen auch eine einfache grafische BenutzeroberflĂ€che, um mit der Anwendung zu interagieren.

Sprache: Python

Datensatz: GTSRB (German Traffic Sign Recognition Benchmark)

Weiterlesen

Quelle: habr.com

60GB SSD 8Gb DDR4