Data Science fĂŒr AnfĂ€nger
1. Sentiment-Analyse (Stimmungsanalyse durch Text)

Sehen Sie sich die vollstĂ€ndige Umsetzung des Data Science-Projekts mit Quellcode an â .
Sentiment-Analyse ist die Analyse von Wörtern zur Bestimmung von Stimmungen und Meinungen, die positiv oder negativ sein können. Es ist eine Art von Klassifikation, bei der die Klassen binĂ€r (positiv und negativ) oder mehrfach (glĂŒcklich, wĂŒtend, traurig, unangenehm ...) sein können. Wir setzen dieses Data Science-Projekt in der Programmiersprache R um und verwenden einen Datensatz aus dem Paket âjaneaustenRâ. Wir verwenden allgemeine WörterbĂŒcher wie AFINN, bing und loughran, fĂŒhren innere VerknĂŒpfungen durch und am Ende erstellen wir eine Wortwolke, um das Ergebnis darzustellen.
Sprache: R
Datensatz/Paket: janeaustenR
Der Artikel wurde mit UnterstĂŒtzung der Firma EDISON Software ĂŒbersetzt, die , sowie .
2. Fake News Detection (Erkennung von Fake News)
Heben Sie Ihre FĂ€higkeiten auf die nĂ€chste Stufe, indem Sie an einem Data Science-Projekt fĂŒr AnfĂ€nger arbeiten â .

Fake News sind falsche Informationen, die ĂŒber soziale Netzwerke und andere Online-Medien verbreitet werden, um politische Ziele zu verfolgen. In dieser Projektidee im Bereich Data Science verwenden wir Python, um ein Modell zu erstellen, das genau bestimmen kann, ob eine Nachricht echt oder falsch ist. Wir erstellen einen TfidfVectorizer und verwenden einen PassiveAggressiveClassifier, um Nachrichten in âechtâ und âfalschâ zu klassifizieren. Wir nutzen einen Datensatz mit der Form 7796 Ă 4 und fĂŒhren alles im Jupyter Lab aus.
Sprache: Python
Datensatz/Paket: news.csv
3. Detecting Parkinsonâs Disease (Erkennung von Parkinson-Krankheit)
Vorankommen, indem Sie an der Projektidee Data Science Project Idea arbeiten â .

Wir haben begonnen, Data Science zur Verbesserung des Gesundheitswesens und der Dienstleistungen einzusetzen â wenn wir Krankheiten frĂŒhzeitig vorhersagen können, haben wir viele Vorteile. In dieser Projektidee im Bereich Data Science lernen wir, wie man die Parkinson-Krankheit mit Python erkennt. Es handelt sich um eine neurodegenerative, fortschreitende Erkrankung des zentralen Nervensystems, die sich auf die Bewegung auswirkt und Zittern und Steifheit verursacht. Sie beeintrĂ€chtigt die Dopamin-produzierenden Neuronen im Gehirn, und jedes Jahr sind mehr als 1 Million Menschen in Indien betroffen.
Sprache: Python
Datensatz/Paket: UCI ML Parkinsons-Datensatz
Data Science Projekte mittlerer KomplexitÀt
4. Spracherkennung von Emotionen
Erfahren Sie mehr ĂŒber die vollstĂ€ndige Umsetzung des Data Science-Projekts â .

Lernen wir nun, verschiedene Bibliotheken zu verwenden. Dieses Data Science-Projekt nutzt librosa zur Spracherkennung. SER ist der Prozess, menschliche Emotionen und affektive ZustĂ€nde durch Sprache zu bestimmen. Da wir Ton und Tonhöhe zur Ausdruck von Emotionen verwenden, ist SER relevant. Aber da Emotionen subjektiv sind, ist die Annotation von Ton sehr herausfordernd. Wir werden die Funktionen mfcc, chroma und mel verwenden und den RAVDESS-Datensatz zur Emotionserkennung nutzen. Wir erstellen einen MLPC-Klassifikator fĂŒr dieses Modell.
Sprache: Python
Datensatz/Paket: RAVDESS-Datensatz
5. Geschlechts- und Altersbestimmung
Beeindrucken Sie Arbeitgeber mit dem neuesten Data Science-Projekt â .

Dies ist ein interessantes Data Science-Projekt mit Python. Anhand eines einzigen Bildes lernen Sie, das Geschlecht und das Alter einer Person vorherzusagen. Dabei fĂŒhren wir Sie in die Computer Vision und deren Prinzipien ein. Wir werden eine verwenden und die Modelle, die von Tal Hassner und Gil Levi fĂŒr den Adience-Datensatz trainiert wurden. Unterwegs verwenden wir einige .pb, .pbtxt, .prototxt und .caffemodel-Dateien.
Sprache: Python
Datensatz/Paket: Adience
6. Uber-Datenanalyse
Sehen Sie sich die vollstĂ€ndige Umsetzung des Data Science-Projekts mit Quellcode an â .

Dies ist ein Datenvisualisierungsprojekt mit ggplot2, bei dem wir R und seine Bibliotheken verwenden werden, um verschiedene Parameter zu analysieren. Wir werden den Datensatz Uber Pickups in New York nutzen und Visualisierungen fĂŒr verschiedene Zeitrahmen des Jahres erstellen. Dies zeigt uns, wie die Zeit die Fahrten der Kunden beeinflusst.
Sprache: R
Datensatz/Paket: Uber Pickups in New York City-Datensatz
7. Erkennung von FahrermĂŒdigkeit
Verbessern Sie Ihre FĂ€higkeiten, indem Sie an einem der besten Data Science-Projekte arbeiten â .

MĂŒdes Fahren ist extrem gefĂ€hrlich und jedes Jahr passieren etwa tausend UnfĂ€lle, weil Fahrer wĂ€hrend der Fahrt einschlafen. In diesem Python-Projekt werden wir ein System erstellen, das mĂŒde Fahrer erkennt und sie akustisch warnt.
Dieses Projekt wurde mit Keras und OpenCV umgesetzt. Wir werden OpenCV zur Gesichtserkennung und zur Erkennung von Augen verwenden, wÀhrend wir mit Keras den Zustand des Auges (Offen oder Geschlossen) mithilfe von Methoden des tiefen neuronalen Netzes klassifizieren werden.
8. Chatbot
Erstellen Sie einen Chatbot mit Python und machen Sie einen Schritt nach vorne in Ihrer Karriere â .

Chatbots sind ein wesentlicher Bestandteil von Unternehmen. Viele Unternehmen mĂŒssen Dienstleistungen fĂŒr ihre Kunden anbieten, was viel Personal, Zeit und Aufwand erfordert. Chatbots können einen groĂen Teil der Kundeninteraktion automatisieren, indem sie auf hĂ€ufige Fragen Antworten geben, die von Kunden gestellt werden. Es gibt hauptsĂ€chlich zwei Arten von Chatbots: DomĂ€nenspezifische und Offene DomĂ€nen. DomĂ€nenspezifische Chatbots werden oft eingesetzt, um spezifische Probleme zu lösen. Daher mĂŒssen Sie sie anpassen, damit sie in Ihrem Bereich effektiv arbeiten. Offene DomĂ€nen-Chatbots können auf beliebige Fragen Antworten geben, weshalb eine groĂe Menge an Daten benötigt wird, um sie zu trainieren.
Datensatz: Intents JSON-Datei
Sprache: Python
Fortgeschrittene Data Science Projekte
9. Bildbeschreibungs-Generator
ĂberprĂŒfen Sie die vollstĂ€ndige Implementierung des Projekts mit Quellcode â .

Die Beschreibung dessen, was auf einem Bild zu sehen ist, ist fĂŒr Menschen eine einfache Aufgabe, aber fĂŒr Computer ist ein Bild einfach eine Reihe von Zahlen, die den Farbwert jedes Pixels darstellen. Es ist eine schwierige Aufgabe fĂŒr Computer. Zu verstehen, was sich in einem Bild befindet, und dann eine Beschreibung in natĂŒrlicher Sprache zu erstellen (zum Beispiel auf Englisch) ist eine weitere schwierige Aufgabe. Dieses Projekt nutzt Methoden des tiefen Lernens, bei denen wir ein Convolutional Neural Network (CNN) mit einem Recurrent Neural Network (LSTM) implementieren, um einen Bildbeschreibungs-Generator zu erstellen.
Datensatz: Flickr 8K
Sprache: Python
Framework: Keras
10. Betrugserkennung bei Kreditkarten
Geben Sie Ihr Bestes, wĂ€hrend Sie an einer Data Science Projektidee arbeiten â .

Bis jetzt haben Sie begonnen, die Methoden und Konzepte zu verstehen. Lassen Sie uns zu einigen fortgeschrittenen Projekten im Bereich Data Science ĂŒbergehen. In diesem Projekt werden wir die Sprache R mit Algorithmen wie , logistische Regression, kĂŒnstliche neuronale Netze und Gradientenboosting-Klassifikator. Wir werden einen Datensatz von Kreditkartenoperationen nutzen, um Transaktionen als betrĂŒgerisch oder echt zu klassifizieren. Wir werden verschiedene Modelle auswĂ€hlen und Leistungsdiagramme erstellen.
Sprache: R
Datensatz/Paket: Datensatz der Kreditkartentransaktionen
11. Filmempfehlungssystem
Erforschen Sie die Implementierung eines der besten Data-Science-Projekte mit Quellcode â

In diesem Data-Science-Projekt werden wir R verwenden, um Filmempfehlungen mithilfe von maschinellem Lernen durchzufĂŒhren. Das Empfehlungssystem unterbreitet den Nutzern VorschlĂ€ge durch einen Filterprozess, der auf den Vorlieben anderer Nutzer und der Geschichte ihrer Ansehen basiert. Wenn A und B âKevin â Allein zu Hauseâ mögen und B âGirls Club â Vorsicht bissigâ liebt, dann könnte man A empfehlen, es ebenfalls zu probieren. Dadurch können sich die Kunden mit der Plattform beschĂ€ftigen.
Sprache: R
Datensatz/Paket: MovieLens-Datensatz
12. Kundensegmentierung
Beeindrucken Sie Arbeitgeber mit einem Data-Science-Projekt (einschlieĂlich Quellcode) â .

Die Segmentierung von KÀufern ist eine beliebte Anwendung Durch Clusterbildung identifizieren Unternehmen Kundensegmente, um mit potenziellen Nutzerbasen zu arbeiten. Sie teilen Kunden in Gruppen basierend auf gemeinsamen Merkmalen wie Geschlecht, Alter, Interessen und Ausgabeverhalten ein, damit sie ihre Produkte effektiv an jede Gruppe verkaufen können. Wir werden verwenden , sowie die Verteilung nach Geschlecht und Alter visualisieren. Danach analysieren wir ihr Jahreseinkommen und Ausgabenverhalten.
Sprache: R
Datensatz/Paket: Mall_Customers-Datensatz
13. Brustkrebs-Klassifizierung
Sehen Sie sich die vollstĂ€ndige Implementierung des Data-Science-Projekts in Python an â .

Kehren wir zum medizinischen Beitrag der Datenwissenschaft zurĂŒck, lassen Sie uns lernen, Brustkrebs mit Python zu identifizieren. Wir werden den Datensatz IDC_regular verwenden, um invasive Duktuskarzinome zu identifizieren, die hĂ€ufigste Form von Brustkrebs. Es entwickelt sich in den MilchgĂ€ngen und dringt in das faserige oder fettige Gewebe der Brust auĂerhalb des Ganges ein. In dieser wissenschaftlichen Projektidee zur Datensammlung werden wir nutzen und die Keras-Bibliothek zur Klassifizierung.
Sprache: Python
Datensatz/Paket: IDC_regular
14. Verkehrsschilderkennung
Die Genauigkeit in der Technologie des autonomen Fahrens mit einem Data-Science-Projekt zur mit Open Source.

Verkehrsschilder und Verkehrsregeln sind fĂŒr jeden Fahrer sehr wichtig, um UnfĂ€lle zu vermeiden. Um eine Regel zu befolgen, muss man zunĂ€chst verstehen, wie ein Verkehrsschild aussieht. Eine Person muss alle Verkehrsschilder lernen, bevor sie den FĂŒhrerschein fĂŒr ŰŁÙ Transportmittel erhĂ€lt. Aber jetzt nimmt die Zahl der autonomen Fahrzeuge zu, und in naher Zukunft wird der Mensch das Auto nicht mehr selbst fahren. In dem Projekt âVerkehrsschilderkennungâ werden Sie lernen, wie ein Programm die Art der Verkehrsschilder erkennen kann, indem es ein Bild als Eingabesignal nimmt. Der deutsche Datensatz fĂŒr die Verkehrsschilderkennung (GTSRB) wird verwendet, um ein tiefes neuronales Netzwerk zur Erkennung der Klasse, zu der das Verkehrsschild gehört, zu erstellen. Wir erstellen auch eine einfache grafische BenutzeroberflĂ€che, um mit der Anwendung zu interagieren.
Sprache: Python
Datensatz: GTSRB (German Traffic Sign Recognition Benchmark)
Weiterlesen
Quelle: habr.com
