14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

Data Science dla początkujących

1. Analiza Nastrojów (Analiza sentymentu poprzez tekst)

14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

Zobacz pełną realizację projektu Data Science z użyciem kodu źródłowego — Projekt Analizy Nastrojów w R.

Analiza nastrojów to analiza słów w celu określenia emocji i opinii, które mogą być pozytywne lub negatywne. To rodzaj klasyfikacji, w której klasy mogą być binarne (pozytywne i negatywne) lub wielokrotne (szczęśliwe, złościwe, smutne, nieprzyjemne …). Zrealizujemy ten projekt Data Science w języku R i będziemy używać zbioru danych z pakietu „janeaustenR”. Użyjemy słowników ogólnego przeznaczenia, takich jak AFINN, bing i loughran, przeprowadzimy wewnętrzne połączenie, a na koniec stworzymy chmurę słów, aby zobrazować wynik.

Język: R
Zbiór danych/Pakiet: janeaustenR

14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

Artykuł został przetłumaczony przy wsparciu firmy EDISON Software, która tworzy wirtualne przymierzalnie dla sklepów multibrandowych, a także testuje oprogramowanie.

2. Wykrywanie Fałszywych Wiadomości (Detection of Fake News)

Podnieś swoje umiejętności na nowy poziom, pracując nad projektem Data Science dla początkujących — wykrywanie fałszywych wiadomości z użyciem Pythona.

14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

Fałszywe wiadomości to nieprawdziwe informacje rozpowszechniane za pośrednictwem mediów społecznościowych i innych mediów informacyjnych w celach politycznych. W tym pomyśle projektu Data Science użyjemy Pythona do budowy modelu, który będzie w stanie dokładnie określić, czy wiadomość jest prawdziwa czy fałszywa. Stworzymy TfidfVectorizer i użyjemy PassiveAggressiveClassifier do klasyfikacji wiadomości na „prawdziwe” i „fałszywe”. Użyjemy zbioru danych o rozmiarze 7796 × 4 i wszystko zrealizujemy w Jupyter Lab.

Język: Python

Zbiór danych/Pakiet: news.csv

3. Wykrywanie Choroby Parkinsona (Detecting Parkinson’s Disease)

Postępuj dalej, pracując nad pomysłem projektu Data Science — wykrywanie choroby Parkinsona z użyciem XGBoost.

14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

Zaczęliśmy używać Data Science, aby poprawić opiekę zdrowotną i usługi — jeśli możemy przewidzieć chorobę we wczesnym stadium, zyskamy wiele korzyści. Tak więc, w tej idei projektu Data Science nauczymy się wykrywać chorobę Parkinsona z użyciem Pythona. To neurodegeneracyjna, postępująca choroba centralnego układu nerwowego, która wpływa na ruch i powoduje drżenie oraz sztywność. Dotyka neuronów produkujących dopaminę w mózgu, a każdego roku dotyka ponad 1 milion osób w Indiach.

Język: Python

Zbiór danych/Pakiet: Zbiór danych UCI ML Parkinsons

Projekty Data Science o średnim stopniu złożoności

4. Rozpoznawanie emocji w mowie

Zapoznaj się z pełną realizacją przykładu projektu Data Science — rozpoznawanie mowy z pomoca Librosa.

14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

Teraz nauczymy się używać różnych bibliotek. Ten projekt Data Science wykorzystuje librosa do rozpoznawania mowy. SER to proces identyfikacji ludzkich emocji i stanów afektywnych na podstawie mowy. Ponieważ do wyrażania emocji w głosie wykorzystujemy ton i wysokość dźwięku, SER ma znaczenie. Jednak ze względu na subiektywność emocji, anotacja dźwięku jest skomplikowanym zadaniem. Użyjemy funkcji mfcc, chroma i mel oraz zestawu danych RAVDESS do rozpoznawania emocji. Stworzymy klasyfikator MLPC dla tego modelu.

Język: Python

Zbiór danych/Pakiet: Zbiór danych RAVDESS

5. Wykrywanie płci i wieku

Zaskocz pracodawców najnowszym projektem Data Science — wykrywanie płci i wieku z pomocą OpenCV.

14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

To interesujący projekt Data Science w Pythonie. Używając jednego zdjęcia, nauczysz się przewidywać płeć i wiek osoby. W tym projekcie zapoznamy cię z wizją komputerową i jej zasadami. Zbudujemy sieć neuronową konwolucyjną i wykorzystamy modele wytrenowane przez Tala Hassnera i Gila Leviego dla zestawu danych Adience. Po drodze wykorzystamy pliki .pb, .pbtxt, .prototxt i .caffemodel.

Język: Python

Zbiór danych/Pakiet: Adience

6. Analiza danych Uber

Zobacz pełną realizację projektu Data Science z kodem źródłowym — Projekt analizy danych Uber w R.

14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

To projekt wizualizacji danych z użyciem ggplot2, w którym wykorzystamy R i jego biblioteki oraz przeanalizujemy różne parametry. Użyjemy zestawu danych Uber Pickups w Nowym Jorku i stworzymy wizualizacje dla różnych okresów w roku. Pokaże to, jak czas wpływa na podróże klientów.

Język: R

Zbiór danych/Pakiet: Zbiór danych Uber Pickups w Nowym Jorku

7. Wykrywanie senności kierowcy

Rozwiń swoje umiejętności, pracując nad Top Projektem Data Science — systemem wykrywania senności z OpenCV i Keras.

14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

Senność podczas prowadzenia pojazdu jest ekstremalnie niebezpieczna, a co roku dochodzi do około tysiąca wypadków z powodu zaśnięcia kierowców w trakcie jazdy. W tym projekcie w Pythonie stworzymy system, który będzie w stanie wykrywać senne osoby oraz powiadamiać je sygnałem dźwiękowym.

Ten projekt został zrealizowany z użyciem Keras i OpenCV. Użyjemy OpenCV do wykrywania twarzy i oczu, a za pomocą Keras będziemy klasyfikować stan oka (Otwarte lub Zamknięte) przy użyciu metod głębokiej sieci neuronowej.

8. Chatbot

Stwórz chatbota za pomocą Pythona i zrób krok naprzód w swojej karierze — Chatbot z NLTK & Keras.

14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

Chatboty są nieodłącznym elementem biznesu. Wiele przedsiębiorstw musi oferować usługi swoim klientom, co wymaga dużej ilości siły roboczej, czasu i wysiłku. Chatboty mogą zautomatyzować dużą część interakcji z klientami, odpowiadając na niektóre z najczęściej zadawanych pytań przez klientów. Istnieją głównie dwa typy chatbotów: specyficzne dla danej dziedziny i ogólnodostępne. Chatbot specyficzny dla danej dziedziny jest często używany do rozwiązania konkretnego problemu, dlatego musisz go dostosować do efektywnego działania w swojej branży. Chatboty ogólnodostępne można pytać o dowolne kwestie, dlatego ich szkolenie wymaga ogromnej ilości danych.

Zbiór danych: Plik json z intencjami

Język: Python

Zaawansowane projekty Data Science

9. Generator Opisów Obrazów

Sprawdź pełną implementację projektu z kodem źródłowym — Generator Opisów Obrazów z CNN & LSTM.

14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

Opis tego, co znajduje się na obrazie, to łatwe zadanie dla ludzi, jednak dla komputerów obraz jest jedynie zbiorem liczb reprezentujących wartość koloru każdego piksela. Jest to trudne zadanie dla komputerów. Zrozumienie tego, co znajduje się na obrazie, a następnie stworzenie opisu w języku naturalnym (np. po angielsku) jest kolejnym trudnym wyzwaniem. Ten projekt wykorzystuje metody głębokiego uczenia, w którym implementujemy konwolucyjną sieć neuronową (CNN) z rekurencyjną siecią neuronową (LSTM) w celu stworzenia generatora opisów obrazów.

Zbiór danych: Flickr 8K

Język: Python

Framework: Keras

10. Wykrywanie oszustw z użyciem kart kredytowych

Zrób wszystko, co możliwe, pracując nad pomysłem projektu Data Science — wykrywanie oszustw z użyciem kart kredytowych przy użyciu uczenia maszynowego.

14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

Do tej pory zaczynasz rozumieć metody i koncepcje. Przejdźmy do kilku zaawansowanych projektów w dziedzinie nauki o danych. W tym projekcie będziemy używać języka R z takimi algorytmami jak drzewa decyzyjne, regresja logistyczna, sztuczne sieci neuronowe i klasyfikator gradientowego wzmocnienia. Wykorzystamy zestaw danych dotyczących transakcji kartą, aby zaklasyfikować transakcje kart kredytowych jako oszukańcze lub prawdziwe. Dobierzemy różne modele i zbudujemy krzywe wydajności.

Język: R

Zbiór danych/Pakiet: Zestaw danych transakcji kartami

11. System rekomendacji filmów

Poznaj implementację najlepszego projektu Data Science z kodem źródłowym — System rekomendacji filmów w języku R

14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

W tym projekcie Data Science użyjemy R do rekomendacji filmów z zastosowaniem uczenia maszynowego. System rekomendacji przesyła sugestie do użytkowników na podstawie procesu filtracji, opartego na preferencjach innych użytkowników i historii oglądania. Jeśli A i B lubią Kevina samego w domu, a B uwielbia Mean Girls, to można zaproponować A – może im się to również spodobać. Pozwala to klientom na interakcję z platformą.

Język: R

Zbiór danych/Pakiet: Zestaw danych MovieLens

12. Segmentacja klientów

Zrób wrażenie na pracodawcach dzięki projektowi Data Science (w tym kod źródłowy) — Segmentacja klientów z użyciem uczenia maszynowego.

14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

Segmentacja klientów jest popularnym zastosowaniem uczenia bez nadzoru. Dzięki klasteryzacji firmy określają segmenty klientów do pracy z potencjalną bazą użytkowników. Dzielą klientów na grupy według wspólnych cech, takich jak płeć, wiek, zainteresowania i nawyki wydawania pieniędzy, aby mogły skutecznie sprzedawać swoje produkty każdej z grup. Użyjemy klasteryzacji K-średnich, a także zwizualizujemy rozkład według płci i wieku. Następnie przeanalizujemy ich roczne dochody i poziom wydatków.

Język: R

Zbiór danych/Pakiet: Zestaw danych Mall_Customers

13. Klasyfikacja raka piersi

Zobacz pełną realizację projektu Data Science w Pythonie — Klasyfikacja raka piersi z pomocą głębokiego uczenia.

14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

Wracając do medycznego wkładu nauki danych, nauczmy się wykrywać raka piersi za pomocą Pythona. Użyjemy zbioru danych IDC_regular do identyfikacji inwazyjnego raka przewodowego, najczęstszej formy raka piersi. Rozwija się on w przewodach mlecznych, wnikając w włóknistą lub tłuszczową tkankę piersi z zewnątrz przewodu. W tym pomyśle na projekt naukowy dotyczący zbierania danych będziemy korzystać z Deep Learning i biblioteki Keras do klasyfikacji.

Język: Python

Zbiór danych/Pakiet: IDC_regular

14. Rozpoznawanie znaków drogowych

Osiągnięcie dokładności w technologii autonomicznych samochodów za pomocą projektu Data Science dotyczącego rozpoznawania znaków drogowych z wykorzystaniem CNN z otwartym źródłem.

14 projektów open-source, aby rozwijać umiejętności w Data Science (łatwe, normalne, trudne)

Znaki drogowe i zasady ruchu drogowego są niezwykle ważne dla każdego kierowcy, aby unikać wypadków. Aby przestrzegać przepisów, najpierw należy zrozumieć, jak wygląda znak drogowy. Człowiek musi zapamiętać wszystkie znaki drogowe, zanim otrzyma prawo jazdy na prowadzenie pojazdu. Jednak teraz liczba pojazdów autonomicznych rośnie, a w najbliższej przyszłości człowiek nie będzie już samodzielnie prowadził samochodu. W projekcie „Rozpoznawanie znaków drogowych” dowiesz się, jak program może rozpoznać typ znaku drogowego, przyjmując obraz jako sygnał wejściowy. Zestaw danych do rozpoznawania znaków drogowych w Niemczech (GTSRB) jest wykorzystywany do budowy głębokiej sieci neuronowej do rozpoznawania klasy, do której należy znak drogowy. Tworzymy również prosty interfejs graficzny do interakcji z aplikacją.

Język: Python

Zbiór danych: GTSRB (Niemiecki benchmark rozpoznawania znaków drogowych)

Czytaj więcej

Źródło: habr.com

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster