Andmete teadus algajatele
1. TunneanalĂŒĂŒs (Tunde analĂŒĂŒs teksti kaudu)

Vaata kogu andmete teaduse projekti teostust lĂ€htekoodi abil â .
TunneanalĂŒĂŒs on sĂ”nade analĂŒĂŒs, et mÀÀrata emotsioone ja arvamusi, mis vĂ”ivad olla positiivsed vĂ”i negatiivsed. See on klassifitseerimise tĂŒĂŒp, kus klassid vĂ”ivad olla binaarsed (positiivsed ja negatiivsed) vĂ”i mitmekesised (rÔÔmsad, kurvad, vihased, vastikud...). Me teostame selle andmete teaduse projekti keeles R ja kasutame andmekogumit paketist âjaneaustenRâ. Me kasutame ĂŒldotstarbelisi sĂ”narooge nagu AFINN, bing ja loughran, teeme sisemisi ĂŒhendusi ja lĂ”puks loome sĂ”napilve, et kuvada tulemusi.
Keele: R
Andmekogum/Pakett: janeaustenR
Artikkel on tÔlgitud ettevÔtte EDISON Software toetusel, mis , samuti .
2. Valeuudiste tuvastamine (Valeuudiste avastamine)
TĂ”sta oma oskusi uuele tasemele, töötades algajate andmete teaduse projekti kallal â .

Valeuudised on vale info, mida levitatakse sotsiaalmeedia ja teiste vÔrgumeedia kaudu poliitiliste eesmÀrkide saavutamiseks. Selles andmete teaduse projekti idees kasutame Pythonit mudeli loomiseks, mis suudab tÀpselt kindlaks teha, kas uudis on tÔene vÔi vale. Loome TfidfVectorizeri ja kasutame PassiveAggressiveClassifierit, et klassifitseerida uudiseid 'reaalseteks' ja 'valeuudisteks'. Kasutame andmekogumit suurusega 7796 à 4 ja teeme kÔik Jupyter Labis.
Keele: Python
Andmekogum/Pakett: news.csv
3. Parkinsoni haiguse tuvastamine (Parkinsoni haiguse avastamine)
Liigu edasi, töötades andmete teaduse projekti idee kallal â .

Olemegi hakanud kasutama andmete teadust tervishoiu ja teenuste parendamiseks â kui saame haiguse varajases staadiumis ennustada, siis on meil palju eeliseid. Nii et selle andmete teaduse projekti idees Ă”pime tuvastama Parkinsoni haigust Pythoniga. See on neurodegeneratiivne, progresseeruv kesknĂ€rvisĂŒsteemi haigus, mis mĂ”jutab liikumist ja pĂ”hjustab vĂ€risemist ja jĂ€ikust. See mĂ”jutab dopamiini tootvaid neuroneid ajus ja igal aastal puudutab see Indias ĂŒle miljoni inimese.
Keele: Python
Andmekogum/Pakett: UCI ML Parkinsoni andmekogum
Andmete teaduse keskrohtude projektid
4. KÔneemotsioonide tuvastamine
Tutvuge tĂ€ispika Data Science projekti nĂ€idisega â .

NĂŒĂŒd Ă”pime kasutama erinevaid teeke. See Data Science projekt kasutab kĂ”ne tuvastamiseks librosa't. SER on protsess, mille kĂ€igus mÀÀratakse inimesse emotsioonid ja affektiivsed seisundid kĂ”ne kaudu. Kuna emotsioonid vĂ€ljendavad meie hÀÀles tonaalsust ja kĂ”rgust, on SER asjakohane. Kuna emotsioonid on subjektiivsed, on helifailide mĂ€rgistamine keeruline ĂŒlesanne. Kasutame mfcc, chroma ja mel funktsioone ning RAVDESS andmestikku emotsioonide tuvastamiseks. Loome MLPC klassifikaatori sellele mudelile.
Keele: Python
Andmekogum/Pakett: RAVDESS andmestik
5. Soolise ja vanuse tuvastamine
PĂŒĂŒdke tööandjate tĂ€helepanu kĂ”ige vĂ€rskema Data Science projektiga â .

See on huvitav Data Science projekt Pythonis. Kasutades ainult ĂŒhte pilti, Ă”pite ennustama inimese soo ja vanust. Selles tutvustame teid arvutinĂ€gemise ja selle pĂ”hialustega. Loome ning kasutame Tal Hassneri ja Gil Levi treenitud mudeleid Adience andmestiku jaoks. Teel kasutame mĂ”ned .pb, .pbtxt, .prototxt ja .caffemodel failid.
Keele: Python
Andmekogum/Pakett: Adience
6. Uberi andmete analĂŒĂŒs
Vaadake tĂ€ispikka Data Science projekti koos lĂ€htekoodiga â .

See on andmete visualiseerimise projekt ggplot2 abil, kus kasutame R-i ja selle teeke ning analĂŒĂŒsime erinevaid parameetreid. Kasutame New Yorgi Uberi Pickups andmestikku ja loome visualiseeringuid erinevate aastaaegade jaoks. See rÀÀgib meile, kuidas aeg mĂ”jutab klientide sĂ”ite.
Keele: R
Andmekogum/Pakett: Uberi Pickups New Yorgi linnas andmestik
7. Juhi uimasuse tuvastamine
Parandage oma oskusi, töötades tipptasemel Data Science projekti kallal â .

Uimasus roolis on ÀÀrmiselt ohtlik ning igal aastal juhtub umbes tuhat Ă”nnetust, kuna juhid magavad sĂ”idu ajal. Sellel Pythonil pĂ”hineval projektis loome sĂŒsteemi, mis suudab tuvastada uimasena juhid ja hoiatada neid helisignaali abil.
See projekt on ellu viidud Keras'i ja OpenCV abil. Kasutame OpenCV-d nĂ€o ja silmade tuvastamiseks ning Keras'i abil klassifitseerime silmade seisundi (Ava vĂ”i Suletud) sĂŒgavate nĂ€rvivĂ”rkude meetodite abil.
8. Vestlusrobot
Looge vestlusrobot Pythoniga ja astuge sammu edasi oma karjÀÀris â .

Vestlusrobotid on ettevĂ”tte lahutamatu osa. Paljudel ettevĂ”tetel on klientidele teenuste pakkumise jaoks vajalik suur tööjĂ”ud, aeg ja vaev. Vestlusrobotid saavad automatiseerida suure osa kliendiga suhtlemisest, vastates mĂ”nele sagedaselt esitatavale kĂŒsimusele. Peamiselt on kaks tĂŒĂŒpi vestlusrobotite: valdkonnapĂ”hised ja avatud domeeniga. ValdkonnapĂ”hised vestlusrobotid on tihti kasutusel konkreetse probleemi lahendamiseks ja seetĂ”ttu tuleb neid teie valdkonnas tĂ”husaks tööks kohandada. Avatud domeeniga vestlusrobotitele saab esitada igasuguseid kĂŒsimusi, mistĂ”ttu nende treenimiseks on vajalik tohutu andmehulk.
Andmekogum: Intentsi json fail
Keele: Python
Kohanenud andeteadlase projektid
9. Pildikirjelduse generaator
Kontrollige projekti tĂ€ielikku teostust allika koodiga â .

Pildi sisu kirjelda on inimestele lihtne ĂŒlesanne, kuid arvutitele on pilt lihtsalt arvude kogum, mis esindavad iga pikseli vĂ€rvitooni vÀÀrtust. See on arvutitele keeruline ĂŒlesanne. Arvutite jaoks mĂ”ista, mis pildil on, ja seejĂ€rel luua loomulikul keelel (nt inglise keeles) kirjeldus, on veel ĂŒks keeruline ĂŒlesanne. See projekt kasutab sĂŒgava Ă”ppimise meetodeid, kus rakendame konvolutsioonivĂ”rku (CNN) koos korduva nĂ€rvivĂ”rguga (LSTM), et luua pildikirjelduse generaator.
Andmekogum: Flickr 8K
Keele: Python
Raamistik: , mis pakub mitmeid mudeli koostamise liideseid (Sequential, Functional, Subclassing) ja vÔimaldab nende
10. Krediitkaardi pettuste tuvastamine
Tehke kĂ”ik endast olenev, töötades vĂ€lja andeteaduse projekti idee â .

Kuni tĂ€nase pĂ€evani olete hakanud mĂ”istma meetodeid ja kontseptsioone. Liigume nĂŒĂŒd mĂ”nede arenenud andeteaduse projektide juurde. Selles projektis kasutame R keelt selliste algoritmide nagu , logistika regressioon, tehisintellekti neuronvĂ”rgud ja gradienteerimise klassifikaator. Kasutame kaarditehingute andmestikku, et klassifitseerida krediitkaarditehingud petuskeemideks ja ehtiteks. Valime neile erinevad mudelid ja koostame jĂ”udluskaardid.
Keele: R
Andmekogum/Pakett: Kaarditehingute andmestik
11. Filmide SoovitussĂŒsteem
Uurige parima andmeanalĂŒĂŒsi projekti teostust koos lĂ€htekoodiga â

Selles andmeanalĂŒĂŒsi projektis kasutame R-i, et teha filmisoovitusi masinĂ”ppe kaudu. SoovitussĂŒsteem saadab kasutajatele ettepanekuid, pĂ”hinedes teiste kasutajate eelistustele ja vaatamisharjumustele. Kui A ja B meeldib Home Alone, ja B armastab Mean Girls, siis vĂ”iks A-le soovitada â see vĂ”iks talle samuti meeldida. See vĂ”imaldab klientidel platvormiga suhelda.
Keele: R
Andmekogum/Pakett: MovieLens andmestik
12. Klientide Segmenteerimine
KĂ€ivitage iseloomulik mulje tööandjatele andmeanalĂŒĂŒsi projekti abil (sealhulgas lĂ€htekood) â .

Klientide segmenteerimine on populaarne rakendus . Klasterdamise abil mÀÀravad ettevĂ”tted kliendisegmendid, millega töötada potentsiaalses kasutajate baas. Nad jaotavad kliendid rĂŒhmadesse vastavalt ĂŒhistele omadustele nagu sugu, vanus, huvid ja kulutamisharjumused, et nad saaksid tĂ”husalt oma tooteid igale rĂŒhmale mĂŒĂŒa. Kasutame , samuti visualiseerime soo ja vanuse jaotuse. seejĂ€rel analĂŒĂŒsime nende aastaseid sissetulekuid ja kulutuste taset.
Keele: R
Andmekogum/Pakett: Mall_Customers andmestik
13. RinnavÀhi Klassifitseerimine
Vaadake tĂ€ielikku andmeanalĂŒĂŒsi projekti teostust Pythonis â .

Tagasi meditsiinilise andmete teaduse panusele, Ôppigem tuvastama rinnavÀhki Pythoniga. Kasutame andmestikku IDC_regular, et tuvastada invasiivne piimajuhade kartsinoom, kÔige levinum rinnavÀhi vorm. See areneb piimajuhades, tungides piima nÀÀrme kiulisse vÔi rasvkoesse vÀljaspool juhade. Selles andmete kogumise teadusprojekti idees kasutame ja Keras'i raamatukogu klassifitseerimiseks.
Keele: Python
Andmekogum/Pakett: IDC_regular
14. LiiklusmÀrkide tuvastamine
TÀpse auto isesÔitmise tehnoloogia saavutamine andmeteaduse projekti abil, avatud lÀhtekoodiga.

LiiklusmĂ€rkide ja liiklusreeglite tundmine on iga juhile vĂ€ga oluline, et vĂ€ltida Ă”nnetusi. Reeglitest kinnipidamiseks peab kĂ”igepealt mĂ”istma, millised liiklusmĂ€rgid vĂ€lja nĂ€evad. Inimene peab Ă”ppima kĂ”ik liiklusmĂ€rgid enne, kui temale antakse lubade juhtida mĂ”nda sĂ”idukit. Kuid praegu kasvab autonoomsete sĂ”idukite arv, ja lĂ€hitulevikus ei pea inimene enam autot iseseisvalt juhtima. LiiklusmĂ€rkide tuvastamise projektis saate teada, kuidas programm suudab tuvastada liiklusmĂ€rgi tĂŒĂŒbi, vĂ”ttes pildi sisendiks. Saksamaa liiklusmĂ€rkide tuvastamise kontrollandmestik (GTSRB) kasutatakse sĂŒgava nĂ€rvivĂ”rgu loomisel, et tuvastada, millisesse klassi liiklusmĂ€rk kuulub. Loome ka lihtsa graafilise liidese rakendusega suhtlemiseks.
Keele: Python
Andmekogum: GTSRB (Saksamaa liiklusmÀrkide tuvastamise standard)
Loe rohkem
Allikas: habr.com
