14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

Andmete teadus algajatele

1. Tunnetuse analĂŒĂŒs (Teksti kaudu tuvastamine)

14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

Vaata tĂ€ielikku andmete teaduse projekti teostust, kasutades allikat — Tunnetuse analĂŒĂŒsi projekt R-is.

Tunnetuse analĂŒĂŒs — see on sĂ”nade analĂŒĂŒs, et mÀÀrata emotsioone ja arvamusi, mis vĂ”ivad olla positiivsed vĂ”i negatiivsed. See on klassifitseerimise tĂŒĂŒp, kus klassid vĂ”ivad olla kas binaarsed (positiivsed ja negatiivsed) vĂ”i mitmekesised (Ă”nnelikud, tigedad, kurvad, vastikud 
). Teeme selle andmete teaduse projekti R keeles ja kasutame andmekogumit paketis „janeaustenR“. Kasutame ĂŒldotstarbelisi sĂ”naraamatuid nagu AFINN, bing ja loughran, teeme sisemise ĂŒhenduse ja lĂ”pus loome sĂ”napilve, et visualiseerida tulemust.

Keel: R
Andmekogum/Pakett: janeaustenR

14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

Artikkel on tÔlgitud EDISON Software'i toetusel, kes loob virtuaalseid prooviruumid mitme brÀndi kauplustele, samuti katsetab tarkvara.

2. Valeuudiste tuvastamine (Fake News Detection)

TĂ”sta oma oskusi uuele tasemele, töötades algajate andmete teaduse projektiga — valeuudiste tuvastamine Pythoniga.

14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

Valeuudised on vale teave, mida jagatakse sotsiaalmeedias ja muudes vĂ”rgumeediates poliitiliste eesmĂ€rkide saavutamiseks. Selles andmete teaduse projekti idees kasutame Pythonit mudeli loomiseks, mis suudab tĂ€pselt mÀÀrata, kas uudis on tĂ”ene vĂ”i vale. Loome TfidfVectorizeri ja kasutame PassiveAggressiveClassifierit uudiste klassifitseerimiseks „reaalseteks“ ja „valeuudisteks“. Kasutame andmestikku, mille vorm on 7796 × 4, ja teeme kĂ”ik Jupyter Labis.

Keel: Python

Andmekogum/Pakett: news.csv

3. Parkinsoni haiguse tuvastamine

Liigu edasi, töötades andmete teaduse projekti idee kallal — Parkinsoni haiguse tuvastamine XGBoostiga.

14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

Alustasime andmete teaduse kasutamist tervishoiu ja teenuste parandamiseks — kui saame haigust varakult ennustada, on meil palju eeliseid. Niisiis, selles andmete teaduse projekti idees Ă”pime tuvastama Parkinsoni haigust Pythoniga. See on neurodegeneratiivne, progresseeruv keskne nĂ€rvisĂŒsteemi haigus, mis mĂ”jutab liikumist ja pĂ”hjustab vĂ€rinaid ja jĂ€ikust. See mĂ”jutab dopamiini tootvaid neuroneid ajus ning igal aastal mĂ”jutab see rohkem kui miljonit inimest Indias.

Keel: Python

Andmekogum/Pakett: UCI ML Parkinsoni andmekogum

Keskmise keerukusega andmete teaduse projektid

4. KÔne emotsioonide tuvastamine

Vaata tĂ€ielikku andmete teaduse projekti nĂ€idet — kĂ”ne tuvastamine Librosaga.

14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

NĂŒĂŒd Ă”pime kasutama erinevaid teeke. See andmete teaduse projekt kasutab librosat kĂ”ne tuvastamiseks. SER on protsess, mis mÀÀrab inimeste emotsioone ja afektiivseid seisundeid kĂ”nest. Kuna me kasutame emotsioonide vĂ€ljendamiseks tooni ja helikĂ”rgust, on SER aktuaalne. Kuid kuna emotsioonid on subjektiivsed, on heli mĂ€rgistamine keeruline ĂŒlesanne. Kasutame mfcc, chroma ja mel funktsioone ning kasutame emotsioonide tuvastamiseks RAVDESS andmestikku. Loome selle mudeli jaoks MLPC klassifikaatori.

Keel: Python

Andmekogum/Pakett: RAVDESS andmestik

5. Soolise ja vanuse tuvastamine

Pimestage tööandjaid selle uusima andmete teaduse projektiga — sugude ja vanuse mÀÀramine OpenCV-ga.

14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

See on pĂ”nev andmete teaduse projekt Pythonis. Kasutades ainult ĂŒhte pilti, Ă”pite ennustama inimese soo ja vanust. Selles tutvustame teile arvutinĂ€gemist ja selle pĂ”himĂ”tteid. Loome konvolutsioonilise nĂ€rvivĂ”rgu ja kasutame Tal Hassneri ja Gil Levy mudeleid Adience andmestikule. Teel kasutame mĂ”ningaid .pb, .pbtxt, .prototxt ja .caffemodel faile.

Keel: Python

Andmekogum/Pakett: Adience

6. Uberi andmete analĂŒĂŒs

Vaata tĂ€ielikku andmete teaduse projekti teostust — Uberi andmete analĂŒĂŒsi projekt R-is.

14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

See on andmete visualiseerimise projekt ggplot2-ga, kus kasutame R ja selle teeke ning analĂŒĂŒsime erinevaid parameetreid. Kasutame New Yorgi Uberi ĂŒlesvĂ”ttete andmestikku ja loome visualiseerimisi erinevate aastaaegade jaoks. See nĂ€itab meile, kuidas aeg mĂ”jutab klientide reiside arvu.

Keel: R

Andmekogum/Pakett: Uberi ĂŒlesvĂ”tted New Yorgis

7. Juhi unisuse tuvastamine

Arendage oma oskusi, töötades tipptasemel andmete teaduse projekti kallal — unisuse tuvastamissĂŒsteem OpenCV ja Kerasiga.

14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

Unine sĂ”itmine on ÀÀrmiselt ohtlik ning igal aastal toimub umbes tuhandeid Ă”nnetusi, kuna juhid uinutavad sĂ”idu ajal. Sellel Pythonil pĂ”hineval projektis loome sĂŒsteemi, mis suudab tuvastada uniseid juhte ning teavitada neid helisignaali kaudu.

See projekt on teostatud Keras ja OpenCV abil. Kasutame OpenCV-d nĂ€o ja silmade tuvastamiseks ning Keras on meie silmade oleku (Avatud vĂ”i Suletud) klassifitseerimise jaoks sĂŒvaĂ”ppe meetodite abil.

8. Chatbot

Looge chatbot Pythoniga ja astuge oma karjÀÀris edasi — Chatbot NLTK & Kerasiga.

14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

Chatbotid on Ă€ri lahutamatu osa. Paljud ettevĂ”tted peavad pakkuma teenuseid oma klientidele, ja selleks on vaja palju tööjĂ”udu, aega ja pingutust. Chatbotid saavad automatiseerida suure osa kliendisuhtlusest, vastates mĂ”nele klientide sagedaselt esitatud kĂŒsimusele. Peamiselt on kahte tĂŒĂŒpi chatbot'e: domaani-spetsiifilised ja avatud domeeniga. Domaani-spetsiifilisi chatbot'e kasutatakse sageli konkreetse probleemi lahendamiseks, seega peate need oma valdkonnas tĂ”husalt toimimiseks kohandama. Avatud domeeni chatbot'idele vĂ”ib esitada igasuguseid kĂŒsimusi, seetĂ”ttu nĂ”uab nende koolitamine tohutut andmehulka.

Andmekogum: Intents json fail

Keel: Python

EdasijÔudnud andeteaduse projektid

9. Image Caption Generator (Pildi Kirjeldaja)

Vaadake projekti tĂ€ielikku teostust koos allika koodiga — Pildi Kirjeldaja CNN & LSTM abil.

14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

Pildi sisu kirjeldamine on inimestele lihtne ĂŒlesanne, kuid arvutite jaoks on pilt lihtsalt numbrite kogum, mis esindab iga piksliga seotud vĂ€rvi vÀÀrtust. See on arvutite jaoks keeruline ĂŒlesanne. MĂ”ista, mis pildil on, ja seejĂ€rel luua loomuliku keele (nĂ€iteks inglise keeles) kirjeldus, on teine keeruline ĂŒlesanne. See projekt kasutab sĂŒvaĂ”ppe meetodeid, kus me rakendame konvolutsioonilist nĂ€rvivĂ”rku (CNN) koos korduvate nĂ€rvivĂ”rkudega (LSTM), et luua pildi kirjeldaja.

Andmekogum: Flickr 8K

Keel: Python

Raamistik: Keras

10. Credit Card Fraud Detection (Krediitkaartide Pettuse Tuvastamine)

Maxige oma vĂ”imalusi, töötades andeteaduse projektiga — krediitkaartide pettuse tuvastamine masinĂ”ppe abil.

14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

Kuni praeguseni olete hakanud mÔistma meetodeid ja kontseptsioone. Liigugem edasi mÔnele edasijÔudnud andeteaduse projektile. Selles projektis kasutame R keelt koos selliste algoritmidega nagu otsustuspuud, logistiline regressioon, tehisnÀrvivÔrgud ja gradienttÔuke klassifikaator. Kasutame kaarditehingute andmekogumit, et klassifitseerida krediitkaarditehingud kui petlikud ja ehtsad. Me kohandame neile erinevaid mudeleid ja koostame jÔudluskÔverad.

Keel: R

Andmekogum/Pakett: Kaarditehingute andmekogum

11. Movie Recommendation System (Filmi SoovitussĂŒsteem)

Uurige vĂ€lja parima andeteaduse projekti teostus koos allika koodiga — Filmi SoovitussĂŒsteem R keeles

14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

Selles andeteaduse projektis kasutame R-i, et teha filme soovitusi masinĂ”ppe abil. SoovitussĂŒsteem edastab kasutajatele ettepanekud, tuginedes teiste kasutajate eelistustele ja vaatamisajaloolle. Kui A ja B meeldib Home Alone, ja B armastab Mean Girls, siis vĂ”ib A-le soovitada — vĂ”ib-olla meeldib see ka talle. See vĂ”imaldab klientidel suhelda platvormiga.

Keel: R

Andmekogum/Pakett: MovieLens andmekogum

12. Customer Segmentation (Kliendi Sisetamine)

KĂŒpsetage tööandjatele muljet andeteaduse projektiga (koos allika koodiga) — Kliendi segmenteerimine masinĂ”ppe abil.

14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

Kliendi segmenteerimine on populaarne rakendus jĂ€relevalveta Ă”ppimise (unsupervised learning). Klasterdamise abil mÀÀravad ettevĂ”tted kliendisegmentide, et töötada potentsiaalse kasutajaskonnaga. Nad jagavad kliente rĂŒhmadesse vastavalt sarnastele omadustele, nĂ€iteks soole, vanusele, huvidele ja harjumustele, et nad saaksid tĂ”husalt mĂŒĂŒa oma tooteid igale rĂŒhmale. Me kasutame K-means klasterdamist, samuti visualiseerime soo ja vanuse jaotust. SeejĂ€rel analĂŒĂŒsime nende aastaseid sissetulekuid ja kulutusi.

Keel: R

Andmekogum/Pakett: Mall_Customers andmekogum

13. Breast Cancer Classification (RinnavÀhi Klassifitseerimine)

Vaadake tĂ€ielikku andeteaduse projekti teostust Pythonis — RinnavĂ€hi klassifitseerimine sĂŒvaĂ”ppe abil.

14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

Naastes andmeteaduse meditsiinilistele panustele, Ă”ppime tuvastama rinnavĂ€hki Pythoniga. Kasutame andmekogumit IDC_regular, et tuvastada invasiivset piimanÀÀrmekartsinoomi, mis on kĂ”ige levinum rinnavĂ€hi vorm. See areneb piimanÀÀrmete kanalites, tungides kanali alt vĂ€lja kiulisse vĂ”i rasvasesse koe. Selles andmekogumise teadusprojektis kasutame SĂŒgavĂ”pe ja Keras raamatukogu klassifitseerimiseks.

Keel: Python

Andmekogum/Pakett: IDC_regular

14. Teede liiklusmÀrkide tuvastamine

Autonoomse sÔiduki tehnoloogia tÀpsuse saavutamine andmeteaduse projekti kaudu liiklusmÀrkide tuvastamiseks CNN-i abil avaallikaga.

14 avatud lÀhtekoodiga projekti, et arendada oma andmete teaduse oskusi (lihtne, normaalne, keeruline)

LiiklusmĂ€rgid ja liiklusreeglid on iga juhi jaoks ÀÀrmiselt olulised, et vĂ€ltida Ă”nnetusi. Reeglitest kinni pidamiseks tuleb kĂ”igepealt mĂ”ista, millised liiklusmĂ€rgid vĂ€lja nĂ€evad. Inimene peab Ă”ppima kĂ”iki liiklusmĂ€rke, enne kui talle antakse luba juhtida igasuguseid sĂ”idukeid. Kuid nĂŒĂŒd kasvab autonoomsete sĂ”idukite arv ja lĂ€hitulevikus ei juhita autot enam iseseisvalt. Projekti "LiiklusmĂ€rkide tuvastamine" kĂ€igus Ă”pite, kuidas programm suudab tuvastada, milline liiklusmĂ€rk on, vĂ”ttes pildi sisendiks. Saksamaa liiklusmĂ€rkide tuvastamise andmestik (GTSRB) kasutatakse sĂŒgava nĂ€rvivĂ”rgu ehitamiseks selle klassi tuvastamiseks, kuhu liiklusmĂ€rk kuulub. Loome ka lihtsa graafilise liidese rakendusega suhtlemiseks.

Keel: Python

Andmekogum: GTSRB (Saksa liiklusmÀrkide tuvastamise nÀidis)

Loe veel

Allikas: habr.com

Osta usaldusvÀÀrne veebihosting DDoS kaitsega, VPS VDS serverid đŸ”„ Osta usaldusvÀÀrne veebihosting DDoS kaitsega, VPS VDS serverid | ProHoster