Data Science dla początkujących
1. Analiza Nastrojów (Analiza sentymentu poprzez tekst)

Zobacz pełną realizację projektu Data Science z użyciem kodu źródłowego — .
Analiza nastrojów to analiza słów w celu określenia emocji i opinii, które mogą być pozytywne lub negatywne. To rodzaj klasyfikacji, w której klasy mogą być binarne (pozytywne i negatywne) lub wielokrotne (szczęśliwe, złościwe, smutne, nieprzyjemne …). Zrealizujemy ten projekt Data Science w języku R i będziemy używać zbioru danych z pakietu „janeaustenR”. Użyjemy słowników ogólnego przeznaczenia, takich jak AFINN, bing i loughran, przeprowadzimy wewnętrzne połączenie, a na koniec stworzymy chmurę słów, aby zobrazować wynik.
Język: R
Zbiór danych/Pakiet: janeaustenR
Artykuł został przetłumaczony przy wsparciu firmy EDISON Software, która , a także .
2. Wykrywanie Fałszywych Wiadomości (Detection of Fake News)
Podnieś swoje umiejętności na nowy poziom, pracując nad projektem Data Science dla początkujących — .

Fałszywe wiadomości to nieprawdziwe informacje rozpowszechniane za pośrednictwem mediów społecznościowych i innych mediów informacyjnych w celach politycznych. W tym pomyśle projektu Data Science użyjemy Pythona do budowy modelu, który będzie w stanie dokładnie określić, czy wiadomość jest prawdziwa czy fałszywa. Stworzymy TfidfVectorizer i użyjemy PassiveAggressiveClassifier do klasyfikacji wiadomości na „prawdziwe” i „fałszywe”. Użyjemy zbioru danych o rozmiarze 7796 × 4 i wszystko zrealizujemy w Jupyter Lab.
Język: Python
Zbiór danych/Pakiet: news.csv
3. Wykrywanie Choroby Parkinsona (Detecting Parkinson’s Disease)
Postępuj dalej, pracując nad pomysłem projektu Data Science — .

Zaczęliśmy używać Data Science, aby poprawić opiekę zdrowotną i usługi — jeśli możemy przewidzieć chorobę we wczesnym stadium, zyskamy wiele korzyści. Tak więc, w tej idei projektu Data Science nauczymy się wykrywać chorobę Parkinsona z użyciem Pythona. To neurodegeneracyjna, postępująca choroba centralnego układu nerwowego, która wpływa na ruch i powoduje drżenie oraz sztywność. Dotyka neuronów produkujących dopaminę w mózgu, a każdego roku dotyka ponad 1 milion osób w Indiach.
Język: Python
Zbiór danych/Pakiet: Zbiór danych UCI ML Parkinsons
Projekty Data Science o średnim stopniu złożoności
4. Rozpoznawanie emocji w mowie
Zapoznaj się z pełną realizacją przykładu projektu Data Science — .

Teraz nauczymy się używać różnych bibliotek. Ten projekt Data Science wykorzystuje librosa do rozpoznawania mowy. SER to proces identyfikacji ludzkich emocji i stanów afektywnych na podstawie mowy. Ponieważ do wyrażania emocji w głosie wykorzystujemy ton i wysokość dźwięku, SER ma znaczenie. Jednak ze względu na subiektywność emocji, anotacja dźwięku jest skomplikowanym zadaniem. Użyjemy funkcji mfcc, chroma i mel oraz zestawu danych RAVDESS do rozpoznawania emocji. Stworzymy klasyfikator MLPC dla tego modelu.
Język: Python
Zbiór danych/Pakiet: Zbiór danych RAVDESS
5. Wykrywanie płci i wieku
Zaskocz pracodawców najnowszym projektem Data Science — .

To interesujący projekt Data Science w Pythonie. Używając jednego zdjęcia, nauczysz się przewidywać płeć i wiek osoby. W tym projekcie zapoznamy cię z wizją komputerową i jej zasadami. Zbudujemy i wykorzystamy modele wytrenowane przez Tala Hassnera i Gila Leviego dla zestawu danych Adience. Po drodze wykorzystamy pliki .pb, .pbtxt, .prototxt i .caffemodel.
Język: Python
Zbiór danych/Pakiet: Adience
6. Analiza danych Uber
Zobacz pełną realizację projektu Data Science z kodem źródłowym — .

To projekt wizualizacji danych z użyciem ggplot2, w którym wykorzystamy R i jego biblioteki oraz przeanalizujemy różne parametry. Użyjemy zestawu danych Uber Pickups w Nowym Jorku i stworzymy wizualizacje dla różnych okresów w roku. Pokaże to, jak czas wpływa na podróże klientów.
Język: R
Zbiór danych/Pakiet: Zbiór danych Uber Pickups w Nowym Jorku
7. Wykrywanie senności kierowcy
Rozwiń swoje umiejętności, pracując nad Top Projektem Data Science — .

Senność podczas prowadzenia pojazdu jest ekstremalnie niebezpieczna, a co roku dochodzi do około tysiąca wypadków z powodu zaśnięcia kierowców w trakcie jazdy. W tym projekcie w Pythonie stworzymy system, który będzie w stanie wykrywać senne osoby oraz powiadamiać je sygnałem dźwiękowym.
Ten projekt został zrealizowany z użyciem Keras i OpenCV. Użyjemy OpenCV do wykrywania twarzy i oczu, a za pomocą Keras będziemy klasyfikować stan oka (Otwarte lub Zamknięte) przy użyciu metod głębokiej sieci neuronowej.
8. Chatbot
Stwórz chatbota za pomocą Pythona i zrób krok naprzód w swojej karierze — .

Chatboty są nieodłącznym elementem biznesu. Wiele przedsiębiorstw musi oferować usługi swoim klientom, co wymaga dużej ilości siły roboczej, czasu i wysiłku. Chatboty mogą zautomatyzować dużą część interakcji z klientami, odpowiadając na niektóre z najczęściej zadawanych pytań przez klientów. Istnieją głównie dwa typy chatbotów: specyficzne dla danej dziedziny i ogólnodostępne. Chatbot specyficzny dla danej dziedziny jest często używany do rozwiązania konkretnego problemu, dlatego musisz go dostosować do efektywnego działania w swojej branży. Chatboty ogólnodostępne można pytać o dowolne kwestie, dlatego ich szkolenie wymaga ogromnej ilości danych.
Zbiór danych: Plik json z intencjami
Język: Python
Zaawansowane projekty Data Science
9. Generator Opisów Obrazów
Sprawdź pełną implementację projektu z kodem źródłowym — .

Opis tego, co znajduje się na obrazie, to łatwe zadanie dla ludzi, jednak dla komputerów obraz jest jedynie zbiorem liczb reprezentujących wartość koloru każdego piksela. Jest to trudne zadanie dla komputerów. Zrozumienie tego, co znajduje się na obrazie, a następnie stworzenie opisu w języku naturalnym (np. po angielsku) jest kolejnym trudnym wyzwaniem. Ten projekt wykorzystuje metody głębokiego uczenia, w którym implementujemy konwolucyjną sieć neuronową (CNN) z rekurencyjną siecią neuronową (LSTM) w celu stworzenia generatora opisów obrazów.
Zbiór danych: Flickr 8K
Język: Python
Framework: Keras
10. Wykrywanie oszustw z użyciem kart kredytowych
Zrób wszystko, co możliwe, pracując nad pomysłem projektu Data Science — .

Do tej pory zaczynasz rozumieć metody i koncepcje. Przejdźmy do kilku zaawansowanych projektów w dziedzinie nauki o danych. W tym projekcie będziemy używać języka R z takimi algorytmami jak , regresja logistyczna, sztuczne sieci neuronowe i klasyfikator gradientowego wzmocnienia. Wykorzystamy zestaw danych dotyczących transakcji kartą, aby zaklasyfikować transakcje kart kredytowych jako oszukańcze lub prawdziwe. Dobierzemy różne modele i zbudujemy krzywe wydajności.
Język: R
Zbiór danych/Pakiet: Zestaw danych transakcji kartami
11. System rekomendacji filmów
Poznaj implementację najlepszego projektu Data Science z kodem źródłowym —

W tym projekcie Data Science użyjemy R do rekomendacji filmów z zastosowaniem uczenia maszynowego. System rekomendacji przesyła sugestie do użytkowników na podstawie procesu filtracji, opartego na preferencjach innych użytkowników i historii oglądania. Jeśli A i B lubią Kevina samego w domu, a B uwielbia Mean Girls, to można zaproponować A – może im się to również spodobać. Pozwala to klientom na interakcję z platformą.
Język: R
Zbiór danych/Pakiet: Zestaw danych MovieLens
12. Segmentacja klientów
Zrób wrażenie na pracodawcach dzięki projektowi Data Science (w tym kod źródłowy) — .

Segmentacja klientów jest popularnym zastosowaniem . Dzięki klasteryzacji firmy określają segmenty klientów do pracy z potencjalną bazą użytkowników. Dzielą klientów na grupy według wspólnych cech, takich jak płeć, wiek, zainteresowania i nawyki wydawania pieniędzy, aby mogły skutecznie sprzedawać swoje produkty każdej z grup. Użyjemy , a także zwizualizujemy rozkład według płci i wieku. Następnie przeanalizujemy ich roczne dochody i poziom wydatków.
Język: R
Zbiór danych/Pakiet: Zestaw danych Mall_Customers
13. Klasyfikacja raka piersi
Zobacz pełną realizację projektu Data Science w Pythonie — .

Wracając do medycznego wkładu nauki danych, nauczmy się wykrywać raka piersi za pomocą Pythona. Użyjemy zbioru danych IDC_regular do identyfikacji inwazyjnego raka przewodowego, najczęstszej formy raka piersi. Rozwija się on w przewodach mlecznych, wnikając w włóknistą lub tłuszczową tkankę piersi z zewnątrz przewodu. W tym pomyśle na projekt naukowy dotyczący zbierania danych będziemy korzystać z i biblioteki Keras do klasyfikacji.
Język: Python
Zbiór danych/Pakiet: IDC_regular
14. Rozpoznawanie znaków drogowych
Osiągnięcie dokładności w technologii autonomicznych samochodów za pomocą projektu Data Science dotyczącego z otwartym źródłem.

Znaki drogowe i zasady ruchu drogowego są niezwykle ważne dla każdego kierowcy, aby unikać wypadków. Aby przestrzegać przepisów, najpierw należy zrozumieć, jak wygląda znak drogowy. Człowiek musi zapamiętać wszystkie znaki drogowe, zanim otrzyma prawo jazdy na prowadzenie pojazdu. Jednak teraz liczba pojazdów autonomicznych rośnie, a w najbliższej przyszłości człowiek nie będzie już samodzielnie prowadził samochodu. W projekcie „Rozpoznawanie znaków drogowych” dowiesz się, jak program może rozpoznać typ znaku drogowego, przyjmując obraz jako sygnał wejściowy. Zestaw danych do rozpoznawania znaków drogowych w Niemczech (GTSRB) jest wykorzystywany do budowy głębokiej sieci neuronowej do rozpoznawania klasy, do której należy znak drogowy. Tworzymy również prosty interfejs graficzny do interakcji z aplikacją.
Język: Python
Zbiór danych: GTSRB (Niemiecki benchmark rozpoznawania znaków drogowych)
Czytaj więcej
Źródło: habr.com
