14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

Andmete teadus algajatele

1. TunneanalĂŒĂŒs (Tunde analĂŒĂŒs teksti kaudu)

14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

Vaata kogu andmete teaduse projekti teostust lĂ€htekoodi abil — TunneanalĂŒĂŒsi projekt R-is.

TunneanalĂŒĂŒs on sĂ”nade analĂŒĂŒs, et mÀÀrata emotsioone ja arvamusi, mis vĂ”ivad olla positiivsed vĂ”i negatiivsed. See on klassifitseerimise tĂŒĂŒp, kus klassid vĂ”ivad olla binaarsed (positiivsed ja negatiivsed) vĂ”i mitmekesised (rÔÔmsad, kurvad, vihased, vastikud...). Me teostame selle andmete teaduse projekti keeles R ja kasutame andmekogumit paketist „janeaustenR”. Me kasutame ĂŒldotstarbelisi sĂ”narooge nagu AFINN, bing ja loughran, teeme sisemisi ĂŒhendusi ja lĂ”puks loome sĂ”napilve, et kuvada tulemusi.

Keele: R
Andmekogum/Pakett: janeaustenR

14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

Artikkel on tÔlgitud ettevÔtte EDISON Software toetusel, mis loob virtuaalsed proovimisruumid mitme kaubamÀrgi poodide jaoks, samuti testib tarkvara.

2. Valeuudiste tuvastamine (Valeuudiste avastamine)

TĂ”sta oma oskusi uuele tasemele, töötades algajate andmete teaduse projekti kallal — valeuudiste tuvastamine Pythoniga.

14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

Valeuudised on vale info, mida levitatakse sotsiaalmeedia ja teiste vĂ”rgumeedia kaudu poliitiliste eesmĂ€rkide saavutamiseks. Selles andmete teaduse projekti idees kasutame Pythonit mudeli loomiseks, mis suudab tĂ€pselt kindlaks teha, kas uudis on tĂ”ene vĂ”i vale. Loome TfidfVectorizeri ja kasutame PassiveAggressiveClassifierit, et klassifitseerida uudiseid 'reaalseteks' ja 'valeuudisteks'. Kasutame andmekogumit suurusega 7796 × 4 ja teeme kĂ”ik Jupyter Labis.

Keele: Python

Andmekogum/Pakett: news.csv

3. Parkinsoni haiguse tuvastamine (Parkinsoni haiguse avastamine)

Liigu edasi, töötades andmete teaduse projekti idee kallal — Parkinsoni haiguse tuvastamine XGBoostiga.

14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

Olemegi hakanud kasutama andmete teadust tervishoiu ja teenuste parendamiseks — kui saame haiguse varajases staadiumis ennustada, siis on meil palju eeliseid. Nii et selle andmete teaduse projekti idees Ă”pime tuvastama Parkinsoni haigust Pythoniga. See on neurodegeneratiivne, progresseeruv kesknĂ€rvisĂŒsteemi haigus, mis mĂ”jutab liikumist ja pĂ”hjustab vĂ€risemist ja jĂ€ikust. See mĂ”jutab dopamiini tootvaid neuroneid ajus ja igal aastal puudutab see Indias ĂŒle miljoni inimese.

Keele: Python

Andmekogum/Pakett: UCI ML Parkinsoni andmekogum

Andmete teaduse keskrohtude projektid

4. KÔneemotsioonide tuvastamine

Tutvuge tĂ€ispika Data Science projekti nĂ€idisega — kĂ”ne tuvastamine Librosa abil.

14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

NĂŒĂŒd Ă”pime kasutama erinevaid teeke. See Data Science projekt kasutab kĂ”ne tuvastamiseks librosa't. SER on protsess, mille kĂ€igus mÀÀratakse inimesse emotsioonid ja affektiivsed seisundid kĂ”ne kaudu. Kuna emotsioonid vĂ€ljendavad meie hÀÀles tonaalsust ja kĂ”rgust, on SER asjakohane. Kuna emotsioonid on subjektiivsed, on helifailide mĂ€rgistamine keeruline ĂŒlesanne. Kasutame mfcc, chroma ja mel funktsioone ning RAVDESS andmestikku emotsioonide tuvastamiseks. Loome MLPC klassifikaatori sellele mudelile.

Keele: Python

Andmekogum/Pakett: RAVDESS andmestik

5. Soolise ja vanuse tuvastamine

PĂŒĂŒdke tööandjate tĂ€helepanu kĂ”ige vĂ€rskema Data Science projektiga — vana ja soo tuvastamine OpenCV abil.

14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

See on huvitav Data Science projekt Pythonis. Kasutades ainult ĂŒhte pilti, Ă”pite ennustama inimese soo ja vanust. Selles tutvustame teid arvutinĂ€gemise ja selle pĂ”hialustega. Loome konvolutsioonilise nĂ€rvivĂ”rgu ning kasutame Tal Hassneri ja Gil Levi treenitud mudeleid Adience andmestiku jaoks. Teel kasutame mĂ”ned .pb, .pbtxt, .prototxt ja .caffemodel failid.

Keele: Python

Andmekogum/Pakett: Adience

6. Uberi andmete analĂŒĂŒs

Vaadake tĂ€ispikka Data Science projekti koos lĂ€htekoodiga — Uberi andmete analĂŒĂŒsi projekt R-is.

14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

See on andmete visualiseerimise projekt ggplot2 abil, kus kasutame R-i ja selle teeke ning analĂŒĂŒsime erinevaid parameetreid. Kasutame New Yorgi Uberi Pickups andmestikku ja loome visualiseeringuid erinevate aastaaegade jaoks. See rÀÀgib meile, kuidas aeg mĂ”jutab klientide sĂ”ite.

Keele: R

Andmekogum/Pakett: Uberi Pickups New Yorgi linnas andmestik

7. Juhi uimasuse tuvastamine

Parandage oma oskusi, töötades tipptasemel Data Science projekti kallal — uimasuse tuvastamise sĂŒsteem OpenCV & Keras abil.

14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

Uimasus roolis on ÀÀrmiselt ohtlik ning igal aastal juhtub umbes tuhat Ă”nnetust, kuna juhid magavad sĂ”idu ajal. Sellel Pythonil pĂ”hineval projektis loome sĂŒsteemi, mis suudab tuvastada uimasena juhid ja hoiatada neid helisignaali abil.

See projekt on ellu viidud Keras'i ja OpenCV abil. Kasutame OpenCV-d nĂ€o ja silmade tuvastamiseks ning Keras'i abil klassifitseerime silmade seisundi (Ava vĂ”i Suletud) sĂŒgavate nĂ€rvivĂ”rkude meetodite abil.

8. Vestlusrobot

Looge vestlusrobot Pythoniga ja astuge sammu edasi oma karjÀÀris — Vestlusrobot NLTK & Keras'iga.

14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

Vestlusrobotid on ettevĂ”tte lahutamatu osa. Paljudel ettevĂ”tetel on klientidele teenuste pakkumise jaoks vajalik suur tööjĂ”ud, aeg ja vaev. Vestlusrobotid saavad automatiseerida suure osa kliendiga suhtlemisest, vastates mĂ”nele sagedaselt esitatavale kĂŒsimusele. Peamiselt on kaks tĂŒĂŒpi vestlusrobotite: valdkonnapĂ”hised ja avatud domeeniga. ValdkonnapĂ”hised vestlusrobotid on tihti kasutusel konkreetse probleemi lahendamiseks ja seetĂ”ttu tuleb neid teie valdkonnas tĂ”husaks tööks kohandada. Avatud domeeniga vestlusrobotitele saab esitada igasuguseid kĂŒsimusi, mistĂ”ttu nende treenimiseks on vajalik tohutu andmehulk.

Andmekogum: Intentsi json fail

Keele: Python

Kohanenud andeteadlase projektid

9. Pildikirjelduse generaator

Kontrollige projekti tĂ€ielikku teostust allika koodiga — Pildikirjelduse generaator CNN & LSTM'iga.

14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

Pildi sisu kirjelda on inimestele lihtne ĂŒlesanne, kuid arvutitele on pilt lihtsalt arvude kogum, mis esindavad iga pikseli vĂ€rvitooni vÀÀrtust. See on arvutitele keeruline ĂŒlesanne. Arvutite jaoks mĂ”ista, mis pildil on, ja seejĂ€rel luua loomulikul keelel (nt inglise keeles) kirjeldus, on veel ĂŒks keeruline ĂŒlesanne. See projekt kasutab sĂŒgava Ă”ppimise meetodeid, kus rakendame konvolutsioonivĂ”rku (CNN) koos korduva nĂ€rvivĂ”rguga (LSTM), et luua pildikirjelduse generaator.

Andmekogum: Flickr 8K

Keele: Python

Raamistik: , mis pakub mitmeid mudeli koostamise liideseid (Sequential, Functional, Subclassing) ja vÔimaldab nende

10. Krediitkaardi pettuste tuvastamine

Tehke kĂ”ik endast olenev, töötades vĂ€lja andeteaduse projekti idee — krediitkaardi pettuste tuvastamine masinĂ”ppe abil.

14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

Kuni tĂ€nase pĂ€evani olete hakanud mĂ”istma meetodeid ja kontseptsioone. Liigume nĂŒĂŒd mĂ”nede arenenud andeteaduse projektide juurde. Selles projektis kasutame R keelt selliste algoritmide nagu otsustust puudutavad puudega, logistika regressioon, tehisintellekti neuronvĂ”rgud ja gradienteerimise klassifikaator. Kasutame kaarditehingute andmestikku, et klassifitseerida krediitkaarditehingud petuskeemideks ja ehtiteks. Valime neile erinevad mudelid ja koostame jĂ”udluskaardid.

Keele: R

Andmekogum/Pakett: Kaarditehingute andmestik

11. Filmide SoovitussĂŒsteem

Uurige parima andmeanalĂŒĂŒsi projekti teostust koos lĂ€htekoodiga — Filmide soovitussĂŒsteem R keeles

14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

Selles andmeanalĂŒĂŒsi projektis kasutame R-i, et teha filmisoovitusi masinĂ”ppe kaudu. SoovitussĂŒsteem saadab kasutajatele ettepanekuid, pĂ”hinedes teiste kasutajate eelistustele ja vaatamisharjumustele. Kui A ja B meeldib Home Alone, ja B armastab Mean Girls, siis vĂ”iks A-le soovitada — see vĂ”iks talle samuti meeldida. See vĂ”imaldab klientidel platvormiga suhelda.

Keele: R

Andmekogum/Pakett: MovieLens andmestik

12. Klientide Segmenteerimine

KĂ€ivitage iseloomulik mulje tööandjatele andmeanalĂŒĂŒsi projekti abil (sealhulgas lĂ€htekood) — Klientide segmenteerimine masinĂ”ppe avulla.

14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

Klientide segmenteerimine on populaarne rakendus jĂ€relevalveta Ă”ppimise (unsupervised learning). Klasterdamise abil mÀÀravad ettevĂ”tted kliendisegmendid, millega töötada potentsiaalses kasutajate baas. Nad jaotavad kliendid rĂŒhmadesse vastavalt ĂŒhistele omadustele nagu sugu, vanus, huvid ja kulutamisharjumused, et nad saaksid tĂ”husalt oma tooteid igale rĂŒhmale mĂŒĂŒa. Kasutame K-means klasterdamine, samuti visualiseerime soo ja vanuse jaotuse. seejĂ€rel analĂŒĂŒsime nende aastaseid sissetulekuid ja kulutuste taset.

Keele: R

Andmekogum/Pakett: Mall_Customers andmestik

13. RinnavÀhi Klassifitseerimine

Vaadake tĂ€ielikku andmeanalĂŒĂŒsi projekti teostust Pythonis — RinnavĂ€hi klassifitseerimine sĂŒvaĂ”ppe abil.

14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

Tagasi meditsiinilise andmete teaduse panusele, Ă”ppigem tuvastama rinnavĂ€hki Pythoniga. Kasutame andmestikku IDC_regular, et tuvastada invasiivne piimajuhade kartsinoom, kĂ”ige levinum rinnavĂ€hi vorm. See areneb piimajuhades, tungides piima nÀÀrme kiulisse vĂ”i rasvkoesse vĂ€ljaspool juhade. Selles andmete kogumise teadusprojekti idees kasutame SĂŒvaĂ”pe ja Keras'i raamatukogu klassifitseerimiseks.

Keele: Python

Andmekogum/Pakett: IDC_regular

14. LiiklusmÀrkide tuvastamine

TÀpse auto isesÔitmise tehnoloogia saavutamine andmeteaduse projekti abil, kasutades CNN-i liiklusmÀrkide tuvastamiseks avatud lÀhtekoodiga.

14 avatud lÀhtekoodiga projekti Data Science oskuste arendamiseks (lihtne, normaalne, raske)

LiiklusmĂ€rkide ja liiklusreeglite tundmine on iga juhile vĂ€ga oluline, et vĂ€ltida Ă”nnetusi. Reeglitest kinnipidamiseks peab kĂ”igepealt mĂ”istma, millised liiklusmĂ€rgid vĂ€lja nĂ€evad. Inimene peab Ă”ppima kĂ”ik liiklusmĂ€rgid enne, kui temale antakse lubade juhtida mĂ”nda sĂ”idukit. Kuid praegu kasvab autonoomsete sĂ”idukite arv, ja lĂ€hitulevikus ei pea inimene enam autot iseseisvalt juhtima. LiiklusmĂ€rkide tuvastamise projektis saate teada, kuidas programm suudab tuvastada liiklusmĂ€rgi tĂŒĂŒbi, vĂ”ttes pildi sisendiks. Saksamaa liiklusmĂ€rkide tuvastamise kontrollandmestik (GTSRB) kasutatakse sĂŒgava nĂ€rvivĂ”rgu loomisel, et tuvastada, millisesse klassi liiklusmĂ€rk kuulub. Loome ka lihtsa graafilise liidese rakendusega suhtlemiseks.

Keele: Python

Andmekogum: GTSRB (Saksamaa liiklusmÀrkide tuvastamise standard)

Loe rohkem

Allikas: habr.com

Osta usaldusvÀÀrne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid đŸ”„ Osta usaldusvÀÀrne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid | ProHoster