Andmete teadus algajatele
1. Tunnetuse analĂŒĂŒs (Teksti kaudu tuvastamine)

Vaata tĂ€ielikku andmete teaduse projekti teostust, kasutades allikat â .
Tunnetuse analĂŒĂŒs â see on sĂ”nade analĂŒĂŒs, et mÀÀrata emotsioone ja arvamusi, mis vĂ”ivad olla positiivsed vĂ”i negatiivsed. See on klassifitseerimise tĂŒĂŒp, kus klassid vĂ”ivad olla kas binaarsed (positiivsed ja negatiivsed) vĂ”i mitmekesised (Ă”nnelikud, tigedad, kurvad, vastikud âŠ). Teeme selle andmete teaduse projekti R keeles ja kasutame andmekogumit paketis âjaneaustenRâ. Kasutame ĂŒldotstarbelisi sĂ”naraamatuid nagu AFINN, bing ja loughran, teeme sisemise ĂŒhenduse ja lĂ”pus loome sĂ”napilve, et visualiseerida tulemust.
Keel: R
Andmekogum/Pakett: janeaustenR
Artikkel on tÔlgitud EDISON Software'i toetusel, kes , samuti .
2. Valeuudiste tuvastamine (Fake News Detection)
TĂ”sta oma oskusi uuele tasemele, töötades algajate andmete teaduse projektiga â .

Valeuudised on vale teave, mida jagatakse sotsiaalmeedias ja muudes vĂ”rgumeediates poliitiliste eesmĂ€rkide saavutamiseks. Selles andmete teaduse projekti idees kasutame Pythonit mudeli loomiseks, mis suudab tĂ€pselt mÀÀrata, kas uudis on tĂ”ene vĂ”i vale. Loome TfidfVectorizeri ja kasutame PassiveAggressiveClassifierit uudiste klassifitseerimiseks âreaalseteksâ ja âvaleuudisteksâ. Kasutame andmestikku, mille vorm on 7796 Ă 4, ja teeme kĂ”ik Jupyter Labis.
Keel: Python
Andmekogum/Pakett: news.csv
3. Parkinsoni haiguse tuvastamine
Liigu edasi, töötades andmete teaduse projekti idee kallal â .

Alustasime andmete teaduse kasutamist tervishoiu ja teenuste parandamiseks â kui saame haigust varakult ennustada, on meil palju eeliseid. Niisiis, selles andmete teaduse projekti idees Ă”pime tuvastama Parkinsoni haigust Pythoniga. See on neurodegeneratiivne, progresseeruv keskne nĂ€rvisĂŒsteemi haigus, mis mĂ”jutab liikumist ja pĂ”hjustab vĂ€rinaid ja jĂ€ikust. See mĂ”jutab dopamiini tootvaid neuroneid ajus ning igal aastal mĂ”jutab see rohkem kui miljonit inimest Indias.
Keel: Python
Andmekogum/Pakett: UCI ML Parkinsoni andmekogum
Keskmise keerukusega andmete teaduse projektid
4. KÔne emotsioonide tuvastamine
Vaata tĂ€ielikku andmete teaduse projekti nĂ€idet â .

NĂŒĂŒd Ă”pime kasutama erinevaid teeke. See andmete teaduse projekt kasutab librosat kĂ”ne tuvastamiseks. SER on protsess, mis mÀÀrab inimeste emotsioone ja afektiivseid seisundeid kĂ”nest. Kuna me kasutame emotsioonide vĂ€ljendamiseks tooni ja helikĂ”rgust, on SER aktuaalne. Kuid kuna emotsioonid on subjektiivsed, on heli mĂ€rgistamine keeruline ĂŒlesanne. Kasutame mfcc, chroma ja mel funktsioone ning kasutame emotsioonide tuvastamiseks RAVDESS andmestikku. Loome selle mudeli jaoks MLPC klassifikaatori.
Keel: Python
Andmekogum/Pakett: RAVDESS andmestik
5. Soolise ja vanuse tuvastamine
Pimestage tööandjaid selle uusima andmete teaduse projektiga â .

See on pĂ”nev andmete teaduse projekt Pythonis. Kasutades ainult ĂŒhte pilti, Ă”pite ennustama inimese soo ja vanust. Selles tutvustame teile arvutinĂ€gemist ja selle pĂ”himĂ”tteid. Loome ja kasutame Tal Hassneri ja Gil Levy mudeleid Adience andmestikule. Teel kasutame mĂ”ningaid .pb, .pbtxt, .prototxt ja .caffemodel faile.
Keel: Python
Andmekogum/Pakett: Adience
6. Uberi andmete analĂŒĂŒs
Vaata tĂ€ielikku andmete teaduse projekti teostust â .

See on andmete visualiseerimise projekt ggplot2-ga, kus kasutame R ja selle teeke ning analĂŒĂŒsime erinevaid parameetreid. Kasutame New Yorgi Uberi ĂŒlesvĂ”ttete andmestikku ja loome visualiseerimisi erinevate aastaaegade jaoks. See nĂ€itab meile, kuidas aeg mĂ”jutab klientide reiside arvu.
Keel: R
Andmekogum/Pakett: Uberi ĂŒlesvĂ”tted New Yorgis
7. Juhi unisuse tuvastamine
Arendage oma oskusi, töötades tipptasemel andmete teaduse projekti kallal â .

Unine sĂ”itmine on ÀÀrmiselt ohtlik ning igal aastal toimub umbes tuhandeid Ă”nnetusi, kuna juhid uinutavad sĂ”idu ajal. Sellel Pythonil pĂ”hineval projektis loome sĂŒsteemi, mis suudab tuvastada uniseid juhte ning teavitada neid helisignaali kaudu.
See projekt on teostatud Keras ja OpenCV abil. Kasutame OpenCV-d nĂ€o ja silmade tuvastamiseks ning Keras on meie silmade oleku (Avatud vĂ”i Suletud) klassifitseerimise jaoks sĂŒvaĂ”ppe meetodite abil.
8. Chatbot
Looge chatbot Pythoniga ja astuge oma karjÀÀris edasi â .

Chatbotid on Ă€ri lahutamatu osa. Paljud ettevĂ”tted peavad pakkuma teenuseid oma klientidele, ja selleks on vaja palju tööjĂ”udu, aega ja pingutust. Chatbotid saavad automatiseerida suure osa kliendisuhtlusest, vastates mĂ”nele klientide sagedaselt esitatud kĂŒsimusele. Peamiselt on kahte tĂŒĂŒpi chatbot'e: domaani-spetsiifilised ja avatud domeeniga. Domaani-spetsiifilisi chatbot'e kasutatakse sageli konkreetse probleemi lahendamiseks, seega peate need oma valdkonnas tĂ”husalt toimimiseks kohandama. Avatud domeeni chatbot'idele vĂ”ib esitada igasuguseid kĂŒsimusi, seetĂ”ttu nĂ”uab nende koolitamine tohutut andmehulka.
Andmekogum: Intents json fail
Keel: Python
EdasijÔudnud andeteaduse projektid
9. Image Caption Generator (Pildi Kirjeldaja)
Vaadake projekti tĂ€ielikku teostust koos allika koodiga â .

Pildi sisu kirjeldamine on inimestele lihtne ĂŒlesanne, kuid arvutite jaoks on pilt lihtsalt numbrite kogum, mis esindab iga piksliga seotud vĂ€rvi vÀÀrtust. See on arvutite jaoks keeruline ĂŒlesanne. MĂ”ista, mis pildil on, ja seejĂ€rel luua loomuliku keele (nĂ€iteks inglise keeles) kirjeldus, on teine keeruline ĂŒlesanne. See projekt kasutab sĂŒvaĂ”ppe meetodeid, kus me rakendame konvolutsioonilist nĂ€rvivĂ”rku (CNN) koos korduvate nĂ€rvivĂ”rkudega (LSTM), et luua pildi kirjeldaja.
Andmekogum: Flickr 8K
Keel: Python
Raamistik: Keras
10. Credit Card Fraud Detection (Krediitkaartide Pettuse Tuvastamine)
Maxige oma vĂ”imalusi, töötades andeteaduse projektiga â .

Kuni praeguseni olete hakanud mÔistma meetodeid ja kontseptsioone. Liigugem edasi mÔnele edasijÔudnud andeteaduse projektile. Selles projektis kasutame R keelt koos selliste algoritmidega nagu , logistiline regressioon, tehisnÀrvivÔrgud ja gradienttÔuke klassifikaator. Kasutame kaarditehingute andmekogumit, et klassifitseerida krediitkaarditehingud kui petlikud ja ehtsad. Me kohandame neile erinevaid mudeleid ja koostame jÔudluskÔverad.
Keel: R
Andmekogum/Pakett: Kaarditehingute andmekogum
11. Movie Recommendation System (Filmi SoovitussĂŒsteem)
Uurige vĂ€lja parima andeteaduse projekti teostus koos allika koodiga â

Selles andeteaduse projektis kasutame R-i, et teha filme soovitusi masinĂ”ppe abil. SoovitussĂŒsteem edastab kasutajatele ettepanekud, tuginedes teiste kasutajate eelistustele ja vaatamisajaloolle. Kui A ja B meeldib Home Alone, ja B armastab Mean Girls, siis vĂ”ib A-le soovitada â vĂ”ib-olla meeldib see ka talle. See vĂ”imaldab klientidel suhelda platvormiga.
Keel: R
Andmekogum/Pakett: MovieLens andmekogum
12. Customer Segmentation (Kliendi Sisetamine)
KĂŒpsetage tööandjatele muljet andeteaduse projektiga (koos allika koodiga) â .

Kliendi segmenteerimine on populaarne rakendus . Klasterdamise abil mÀÀravad ettevĂ”tted kliendisegmentide, et töötada potentsiaalse kasutajaskonnaga. Nad jagavad kliente rĂŒhmadesse vastavalt sarnastele omadustele, nĂ€iteks soole, vanusele, huvidele ja harjumustele, et nad saaksid tĂ”husalt mĂŒĂŒa oma tooteid igale rĂŒhmale. Me kasutame , samuti visualiseerime soo ja vanuse jaotust. SeejĂ€rel analĂŒĂŒsime nende aastaseid sissetulekuid ja kulutusi.
Keel: R
Andmekogum/Pakett: Mall_Customers andmekogum
13. Breast Cancer Classification (RinnavÀhi Klassifitseerimine)
Vaadake tĂ€ielikku andeteaduse projekti teostust Pythonis â .

Naastes andmeteaduse meditsiinilistele panustele, Ôppime tuvastama rinnavÀhki Pythoniga. Kasutame andmekogumit IDC_regular, et tuvastada invasiivset piimanÀÀrmekartsinoomi, mis on kÔige levinum rinnavÀhi vorm. See areneb piimanÀÀrmete kanalites, tungides kanali alt vÀlja kiulisse vÔi rasvasesse koe. Selles andmekogumise teadusprojektis kasutame ja Keras raamatukogu klassifitseerimiseks.
Keel: Python
Andmekogum/Pakett: IDC_regular
14. Teede liiklusmÀrkide tuvastamine
Autonoomse sÔiduki tehnoloogia tÀpsuse saavutamine andmeteaduse projekti kaudu avaallikaga.

LiiklusmĂ€rgid ja liiklusreeglid on iga juhi jaoks ÀÀrmiselt olulised, et vĂ€ltida Ă”nnetusi. Reeglitest kinni pidamiseks tuleb kĂ”igepealt mĂ”ista, millised liiklusmĂ€rgid vĂ€lja nĂ€evad. Inimene peab Ă”ppima kĂ”iki liiklusmĂ€rke, enne kui talle antakse luba juhtida igasuguseid sĂ”idukeid. Kuid nĂŒĂŒd kasvab autonoomsete sĂ”idukite arv ja lĂ€hitulevikus ei juhita autot enam iseseisvalt. Projekti "LiiklusmĂ€rkide tuvastamine" kĂ€igus Ă”pite, kuidas programm suudab tuvastada, milline liiklusmĂ€rk on, vĂ”ttes pildi sisendiks. Saksamaa liiklusmĂ€rkide tuvastamise andmestik (GTSRB) kasutatakse sĂŒgava nĂ€rvivĂ”rgu ehitamiseks selle klassi tuvastamiseks, kuhu liiklusmĂ€rk kuulub. Loome ka lihtsa graafilise liidese rakendusega suhtlemiseks.
Keel: Python
Andmekogum: GTSRB (Saksa liiklusmÀrkide tuvastamise nÀidis)
Loe veel
Allikas: habr.com
