14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

Data Science për fillestarët

1. Analiza e Ndjenjave (Analiza e ndjenjave përmes tekstit)

14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

Shikoni implementimin e plotĂ« tĂ« projektit Data Science duke pĂ«rdorur kodin burimor — Projekti i AnalizĂ«s sĂ« Ndjenjave nĂ« R.

Analiza e Ndjenjave Ă«shtĂ« analiza e fjalĂ«ve pĂ«r tĂ« pĂ«rcaktuar ndjenjat dhe opinioni, tĂ« cilat mund tĂ« jenĂ« pozitive ose negative. Ky Ă«shtĂ« njĂ« tip klasifikimi, ku klasat mund tĂ« jenĂ« binare (pozitive dhe negative) ose shumĂ«si (tĂ« lumtur, tĂ« zemĂ«ruar, tĂ« trishtuar, tĂ« padĂ«shiruar
). Ne do ta realizojmĂ« kĂ«tĂ« projekt Data Science nĂ« gjuhĂ«n R dhe do tĂ« pĂ«rdorim njĂ« set tĂ« dhĂ«nash nga paketa «janeaustenR». Ne do tĂ« pĂ«rdorim fjalorĂ« tĂ« pĂ«rgjithshĂ«m, si AFINN, bing dhe loughran, do tĂ« kryejmĂ« bashkimin e brendshĂ«m, dhe nĂ« fund do tĂ« krijojmĂ« njĂ« re fjalĂ«sh pĂ«r tĂ« shfaqur rezultatin.

Gjuha: R
Seti i të dhënave/Paketa: janeaustenR

14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

Artikulli është përkthyer me mbështetje nga kompania EDISON Software, e cila krijon kabina virtuale për dyqanet me shumë marka, si dhe teston softuerin.

2. Zbulimi i Lajmeve të Rreme (Detektimi i lajmeve të rreme)

Ngjitni aftĂ«sitĂ« tuaja nĂ« njĂ« nivel tĂ« ri duke punuar nĂ« njĂ« projekt Data Science pĂ«r fillestarĂ«t — zbulimi i lajmeve tĂ« rreme me Python.

14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

Lajmet e rreme janĂ« informacion i rremĂ« qĂ« shpĂ«rndahet pĂ«rmes mediave sociale dhe burimeve tĂ« tjera tĂ« njohura pĂ«r pĂ«rfitime politike. NĂ« kĂ«tĂ« ide projekti pĂ«r Data Science, ne do tĂ« pĂ«rdorim Python pĂ«r tĂ« ndĂ«rtuar njĂ« model qĂ« mund tĂ« klasifikojĂ« saktĂ«sisht nĂ«se njĂ« lajm Ă«shtĂ« i vĂ«rtetĂ« ose i rremĂ«. Ne do tĂ« krijojmĂ« TfidfVectorizer dhe do tĂ« pĂ«rdorim PassiveAggressiveClassifier pĂ«r tĂ« klasifikuar lajmet nĂ« «tĂ« vĂ«rteta» dhe «tĂ« rreme». Ne do tĂ« pĂ«rdorim njĂ« set tĂ« dhĂ«nash me formĂ« 7796 × 4 dhe do tĂ« realizojmĂ« gjithçka nĂ« Jupyter Lab.

Gjuha: Python

Seti i të dhënave/Paketa: news.csv

3. Zbulimi i Sëmundjes së Parkinsonit (Detektimi i sëmundjes së Parkinsonit)

PĂ«rparoni duke punuar nĂ« idenĂ« e projektit pĂ«r Data Science — zbulimi i sĂ«mundjes sĂ« Parkinsonit me XGBoost.

14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

Ne filluam tĂ« pĂ«rdorim Data Science pĂ«r tĂ« pĂ«rmirĂ«suar shĂ«ndetin dhe shĂ«rbimet — nĂ«se mund tĂ« parashikojmĂ« sĂ«mundjen nĂ« fazĂ«n fillestare, atĂ«herĂ« do tĂ« kemi shumĂ« pĂ«rfitime. Pra, nĂ« kĂ«tĂ« ide projekti pĂ«r Data Science, ne do tĂ« mĂ«sojmĂ« si tĂ« zbulojmĂ« sĂ«mundjen e Parkinsonit me Python. Kjo Ă«shtĂ« njĂ« sĂ«mundje neurodegjenerative dhe progresive e sistemit nervor qendror qĂ« ndikon nĂ« lĂ«vizjen dhe shkakton dridhje dhe ngurtĂ«si. Ajo ndikon nĂ« neuronet qĂ« prodhojnĂ« dopaminĂ« nĂ« trurin, dhe çdo vit, prek mĂ« shumĂ« se 1 milion njerĂ«z nĂ« Indi.

Gjuha: Python

Seti i të dhënave/Paketa: UCI ML Parkinsons dataset

Projekte të shkencave të të dhënave me kompleksitet të mesëm

4. Njohja e Emoceve nga Zëri (Speech Emotion Recognition)

Shihni implementimin e plotĂ« tĂ« projektit tĂ« shkencave tĂ« tĂ« dhĂ«nave — njohjen e zĂ«rit me ndihmĂ«n e Librosa.

14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

Tani le të mësojmë si të përdorim biblioteka të ndryshme. Ky projekt në shkencat e të dhënave përdor librosa për njohjen e zërit. SER është procesi i përcaktimit të emocioneve dhe gjendjeve afektive të njeriut përmes zërit. Pasiqë ne përdorim tonin dhe lartësinë e tonit për të shprehur emocione me zë, SER është i rëndësishëm. Por pasi që emocionet janë subjektive, annotimi i zërit është një detyrë e komplikuar. Ne do të përdorim funksionet mfcc, chroma dhe mel dhe do të përdorim setin e të dhënave RAVDESS për njohjen e emocioneve. Ne do të krijojmë një klasifikues MLPC për këtë model.

Gjuha: Python

Seti i të dhënave/Paketa: Seti i të dhënave RAVDESS

5. Zbulimi i Gjenit dhe Moshës (Gender and Age Detection)

Impononi punĂ«dhĂ«nĂ«sit me projektin mĂ« tĂ« ri nĂ« shkencat e tĂ« dhĂ«nave — zbulimi i gjenit dhe moshĂ«s me ndihmĂ«n e OpenCV.

14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

Ky është një projekt interesante në shkencat e të dhënave me Python. Duke përdorur vetëm një imazh, do të mësoni të parashikoni gjenin dhe moshën e një personi. Në këtë projekt, do t'ju njohim me vizionin kompjuterik (Computer Vision) dhe parimet e tij. Ne do të ndërtojmë rrjete neurale konvencionale dhe do të përdorim modelet e trenuara nga Tal Hassner dhe Gil Levi për setin e të dhënave Adience. Gjatë kësaj rruge, do të përdorim disa skedarë .pb, .pbtxt, .prototxt dhe .caffemodel.

Gjuha: Python

Seti i të dhënave/Paketa: Adience

6. Analiza e të Dhënave të Uber (Uber Data Analysis)

Shihni implementimin e plotĂ« tĂ« projektit tĂ« shkencave tĂ« tĂ« dhĂ«nave me kod burimor — Projekti i AnalizĂ«s sĂ« tĂ« DhĂ«nave tĂ« Uber nĂ« R.

14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

Ky projekt është një vizualizim të dhënash me ggplot2, ku ne do të përdorim R dhe bibliotekat e tij për të analizuar parametra të ndryshëm. Ne do të përdorim setin e të dhënave Uber Pickups në New York dhe do të krijojmë vizualizime për kuadro të ndryshme të vitit. Kjo na tregon se si koha ndikon në udhëtimet e klientëve.

Gjuha: R

Seti i të dhënave/Paketa: Seti i të dhënave Uber Pickups në New York City

7. Zbulimi i Gjumit te Shoferëve (Driver Drowsiness Detection)

PĂ«rmirĂ«soni aftĂ«sitĂ« tuaja duke punuar nĂ« projektin kryesor tĂ« shkencave tĂ« tĂ« dhĂ«nave — sistemi i zbulimit tĂ« gjumit me OpenCV & Keras.

14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

Gjumia gjatë drejtimit është jashtëzakonisht e rrezikshme, dhe çdo vit ndodhin rreth një mijë aksidente për shkak se shoferët bien në gjumë gjatë drejtimit. Në këtë projekt me Python, ne do të krijojmë një sistem që do të jetë në gjendje të zbulojë shoferët e gjumitur dhe t'i njoftojë ata me një sinjal zëri.

Ky ky projekt është realizuar duke përdorur Keras dhe OpenCV. Ne do të përdorim OpenCV për të identifikuar fytyrën dhe sytë, dhe me Keras do të klasifikojmë gjendjen e syrit (Të Hapura ose Të Mbyllura) duke përdorur metoda të rrjeteve neuronale të thella.

8. Chatbot

Krijoni njĂ« chatbot me Python dhe bĂ«ni njĂ« hap pĂ«rpara nĂ« karrierĂ«n tuaj — Chatbot me NLTK & Keras.

14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

ChatbotĂ«t janĂ« njĂ« pjesĂ« e pamundur e biznesit. ShumĂ« biznese duhet tĂ« ofrojnĂ« shĂ«rbime pĂ«r klientĂ«t e tyre, dhe pĂ«r tĂ« mbĂ«shtetur kĂ«tĂ« kĂ«rkohet shumĂ« forcĂ« pune, kohĂ« dhe pĂ«rpjekje. ChatbotĂ«t mund tĂ« automatizojnĂ« njĂ« pjesĂ« tĂ« madhe tĂ« ndĂ«rveprimit me klientĂ«t, duke u pĂ«rgjigjur disa pyetjeve tĂ« shpeshta qĂ« bĂ«jnĂ« klientĂ«t. NĂ« thelb ka dy lloje chatbot-Ă«sh: Domain-specific dhe Open-domain. ChatbotĂ«t Domain-specific pĂ«rdoren shpesh pĂ«r tĂ« zgjidhur njĂ« problem specifik. Prandaj, ju duhet ta konfiguroni atĂ« pĂ«r tĂ« punuar nĂ« mĂ«nyrĂ« efektive nĂ« fushĂ«n tuaj. ChatbotĂ«t Open-domain mund t’u bĂ«jnĂ« çdo lloj pyetje, prandaj pĂ«r trajnimin e tyre kĂ«rkohet njĂ« sasi e madhe tĂ« dhĂ«nash.

Grupi i të dhënave: Skedari intents json

Gjuha: Python

Projekte të avancuara të Shkencës së të Dhënave

9. Gjeneratori i përshkrimeve të imazheve

Kontrolloni realizimin e plotĂ« tĂ« projektit me kodin burimor — Gjeneratori i pĂ«rshkrimeve tĂ« imazheve me CNN & LSTM.

14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

Përshkrimi i asaj që ndodhet në një imazh është një detyrë e lehtë për njerëzit, por për kompjuterët, imazhi është thjesht një grup numrash që përfaqësojnë vlerën e ngjyrës për secilin piksel. Kjo është një detyrë e vështirë për kompjuterët. Të kuptosh se çfarë ndodhet në një imazh dhe më pas të krijosh një përshkrim në një gjuhë natyrore (për shembull, në anglisht) është një tjetër detyrë e vështirë. Ky projekt përdor metoda të mësimit të thellë, ku ne zbatojmë një Rrëke Neurale Konvolucionale (CNN) me një Rrëke Neurale Recurrente (LSTM) për të krijuar një gjenerator përshkrimesh për imazhe.

Grupi i të dhënave: Flickr 8K

Gjuha: Python

Framework: Keras

10. Identifikimi i Mashtrimit me Kartat e Kreditit

BĂ«ni gjithçka qĂ« Ă«shtĂ« e mundur duke punuar mbi idenĂ« e projektit tĂ« ShkencĂ«s sĂ« tĂ« DhĂ«nave — identifikimi i mashtrimit me kartat e kreditit duke pĂ«rdorur mĂ«simin e makinerive.

14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

Derisa të arritni tani, ju keni filluar të kuptoni metodat dhe konceptet. Le të kalojmë në disa projekte të avancuara në shkencën e të dhënave. Në këtë projekt, ne do të përdorim gjuhën R me algoritma të tillë si pemët e vendimeve, regresioni logjistik, rrjetet neurale artificiale dhe klasifikuesi i fuqisë gradienti. Ne do të përdorim një grup të dhënash për transaksionet me karta, për të klasifikuar transaksionet e kartave të kreditit si mashtruese dhe të vërteta. Ne do t'i përshtatim atyre modele të ndryshme dhe do të ndjekim kurbat e performancës.

Gjuha: R

Seti i të dhënave/Paketa: Grupi i të dhënave për Transaksionet me Karta

11. Sistemi i Rekomandimeve për Filma

Studio realizimin e projektit mĂ« tĂ« mirĂ« tĂ« Data Science me Kodin Burimor — Sistemi i Rekomandimeve pĂ«r Filma nĂ« gjuhĂ«n R

14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

NĂ« kĂ«tĂ« projekt tĂ« Data Science, ne do tĂ« pĂ«rdorim R pĂ«r tĂ« ofruar rekomandime filmash pĂ«rmes mĂ«simit tĂ« makinerive. Sistemi i rekomandimeve dĂ«rgon sugjerime pĂ«rdoruesve pĂ«rmes njĂ« procesi filtrimi, tĂ« bazuar nĂ« preferencat e pĂ«rdoruesve tĂ« tjerĂ« dhe historinĂ« e shikimeve. NĂ«se A dhe B i pĂ«lqen Home Alone, dhe B e do Mean Girls, atĂ«herĂ« mund t'i sugjerohet A — ata gjithashtu mund t'i pĂ«lqejnĂ«. Kjo lejon klientĂ«t tĂ« interaktin me platformĂ«n.

Gjuha: R

Seti i të dhënave/Paketa: Grupi i të dhënave të MovieLens

12. Segmentimi i Klientëve

BĂ«ni njĂ« pĂ«rshtypje tek punĂ«dhĂ«nĂ«sit me projektin e Data Science (duke pĂ«rfshirĂ« kodin burimor) — Segmentimi i KlientĂ«ve pĂ«rmes MĂ«simit tĂ« Makinerive.

14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

Segmentimi i klientëve është një aplikacion popullor i mësimit të pa mbikëqyrur.Duke përdorur klasterizimin, kompanitë përcaktojnë segmente klientësh për të punuar me bazën e potenciale të përdoruesve. Ato ndajnë klientët në grupe sipas karakteristikave të zakonshme, si gjinia, mosha, interesat dhe zakonet e shpenzimit, në mënyrë që të mund të shesin produktet e tyre me efikasitet për çdo grup. Ne do të përdorim klasterizimin K-means, si dhe do të vizualizojmë shpërndarjen sipas gjinive dhe moshës. Më pas do të analizojmë të ardhurat vjetore dhe nivelin e shpenzimeve të tyre.

Gjuha: R

Seti i të dhënave/Paketa: Grupi i të dhënave të Mall_Customers

13. Klasifikimi i Kancerit të Gjirit

Shikoni realizimin e plotĂ« tĂ« projektit tĂ« Data Science nĂ« Python — Klasifikimi i Kancerit tĂ« Gjirit pĂ«rmes MĂ«simit tĂ« ThellĂ«.

14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

Duke u kthyer në kontributin mjekësor të shkencave të dhënave, le të mësojmë të identifikojmë kancerin e gjirit me ndihmën e Python. Ne do të përdorim setin e të dhënave IDC_regular për të identifikuar karcinomën invazive të kanaleve, formën më të zakonshme të kancerit të gjirit. Ai zhvillohet në kanalet e gjirit, duke u përhapur në indin fibror ose yndyror të gjirit përtej kanalit. Në këtë ide të projektit shkencor për mbledhjen e të dhënave do të përdorim Mësimi i thellë dhe bibliotekën Keras për klasifikim.

Gjuha: Python

Seti i të dhënave/Paketa: IDC_regular

14. Njohja e Shenjave Trafiku

Arritja e saktësisë në teknologjinë e vetë-ndihmës për vozitjen e automjeteve përmes një projekti Shkencë të Dhënash për njohjen e shenjave të trafikut duke përdorur CNN me burim të hapur.

14 projekte open-source për të avancuar aftësitë në Data Science (lehtë, mesatar, e vështirë)

Shenjat e trafikut dhe rregullat e qarkullimit janĂ« shumĂ« tĂ« rĂ«ndĂ«sishme pĂ«r çdo vozitĂ«s pĂ«r tĂ« shmangur aksidentet. PĂ«r tĂ« ndjekur rregullin, fillimisht duhet tĂ« kuptohet se si duket njĂ« shenjĂ« trafiku. NjerĂ«zit duhet tĂ« mĂ«sojnĂ« tĂ« gjitha shenjat e trafikut pĂ«rpara se t'u jepet leja pĂ«r tĂ« drejtuar ndonjĂ« mjet. Por tani numri i automjeteve autonome po rritet, dhe nĂ« tĂ« ardhmen e afĂ«rt njerĂ«zit ndoshta nuk do tĂ« drejtojnĂ« makinĂ«n mĂ« vetĂ«. NĂ« projektin “Njohja e Shenjave Trafikut” do tĂ« mĂ«soni si njĂ« program mund tĂ« identifikojĂ« llojin e shenjave tĂ« trafikut duke pranuar njĂ« imazh si hyrje. Seti i tĂ« dhĂ«nave pĂ«r njohjen e shenjave tĂ« trafikut nĂ« Gjermani (GTSRB) pĂ«rdoret pĂ«r tĂ« ndĂ«rtuar njĂ« rrjet tĂ« thellĂ« nervor pĂ«r tĂ« njohur klasĂ«n e shenjĂ«s sĂ« trafikut. Ne gjithashtu krijojmĂ« njĂ« ndĂ«rfaqe grafike tĂ« thjeshtĂ« pĂ«r ndĂ«rveprimin me aplikacionin.

Gjuha: Python

Grupi i të dhënave: GTSRB (Benchmark për Njohjen e Shenjave të Trafikut në Gjermani)

Lexo më shumë

Burimi: habr.com

Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster