Data Science për fillestarët
1. Analiza e Ndjenjave (Analiza e ndjenjave përmes tekstit)

Shikoni implementimin e plotĂ« tĂ« projektit Data Science duke pĂ«rdorur kodin burimor â .
Analiza e Ndjenjave Ă«shtĂ« analiza e fjalĂ«ve pĂ«r tĂ« pĂ«rcaktuar ndjenjat dhe opinioni, tĂ« cilat mund tĂ« jenĂ« pozitive ose negative. Ky Ă«shtĂ« njĂ« tip klasifikimi, ku klasat mund tĂ« jenĂ« binare (pozitive dhe negative) ose shumĂ«si (tĂ« lumtur, tĂ« zemĂ«ruar, tĂ« trishtuar, tĂ« padĂ«shiruarâŠ). Ne do ta realizojmĂ« kĂ«tĂ« projekt Data Science nĂ« gjuhĂ«n R dhe do tĂ« pĂ«rdorim njĂ« set tĂ« dhĂ«nash nga paketa «janeaustenR». Ne do tĂ« pĂ«rdorim fjalorĂ« tĂ« pĂ«rgjithshĂ«m, si AFINN, bing dhe loughran, do tĂ« kryejmĂ« bashkimin e brendshĂ«m, dhe nĂ« fund do tĂ« krijojmĂ« njĂ« re fjalĂ«sh pĂ«r tĂ« shfaqur rezultatin.
Gjuha: R
Seti i të dhënave/Paketa: janeaustenR
Artikulli është përkthyer me mbështetje nga kompania EDISON Software, e cila , si dhe .
2. Zbulimi i Lajmeve të Rreme (Detektimi i lajmeve të rreme)
Ngjitni aftĂ«sitĂ« tuaja nĂ« njĂ« nivel tĂ« ri duke punuar nĂ« njĂ« projekt Data Science pĂ«r fillestarĂ«t â .

Lajmet e rreme janë informacion i rremë që shpërndahet përmes mediave sociale dhe burimeve të tjera të njohura për përfitime politike. Në këtë ide projekti për Data Science, ne do të përdorim Python për të ndërtuar një model që mund të klasifikojë saktësisht nëse një lajm është i vërtetë ose i rremë. Ne do të krijojmë TfidfVectorizer dhe do të përdorim PassiveAggressiveClassifier për të klasifikuar lajmet në «të vërteta» dhe «të rreme». Ne do të përdorim një set të dhënash me formë 7796 à 4 dhe do të realizojmë gjithçka në Jupyter Lab.
Gjuha: Python
Seti i të dhënave/Paketa: news.csv
3. Zbulimi i Sëmundjes së Parkinsonit (Detektimi i sëmundjes së Parkinsonit)
PĂ«rparoni duke punuar nĂ« idenĂ« e projektit pĂ«r Data Science â .

Ne filluam tĂ« pĂ«rdorim Data Science pĂ«r tĂ« pĂ«rmirĂ«suar shĂ«ndetin dhe shĂ«rbimet â nĂ«se mund tĂ« parashikojmĂ« sĂ«mundjen nĂ« fazĂ«n fillestare, atĂ«herĂ« do tĂ« kemi shumĂ« pĂ«rfitime. Pra, nĂ« kĂ«tĂ« ide projekti pĂ«r Data Science, ne do tĂ« mĂ«sojmĂ« si tĂ« zbulojmĂ« sĂ«mundjen e Parkinsonit me Python. Kjo Ă«shtĂ« njĂ« sĂ«mundje neurodegjenerative dhe progresive e sistemit nervor qendror qĂ« ndikon nĂ« lĂ«vizjen dhe shkakton dridhje dhe ngurtĂ«si. Ajo ndikon nĂ« neuronet qĂ« prodhojnĂ« dopaminĂ« nĂ« trurin, dhe çdo vit, prek mĂ« shumĂ« se 1 milion njerĂ«z nĂ« Indi.
Gjuha: Python
Seti i të dhënave/Paketa: UCI ML Parkinsons dataset
Projekte të shkencave të të dhënave me kompleksitet të mesëm
4. Njohja e Emoceve nga Zëri (Speech Emotion Recognition)
Shihni implementimin e plotĂ« tĂ« projektit tĂ« shkencave tĂ« tĂ« dhĂ«nave â .

Tani le të mësojmë si të përdorim biblioteka të ndryshme. Ky projekt në shkencat e të dhënave përdor librosa për njohjen e zërit. SER është procesi i përcaktimit të emocioneve dhe gjendjeve afektive të njeriut përmes zërit. Pasiqë ne përdorim tonin dhe lartësinë e tonit për të shprehur emocione me zë, SER është i rëndësishëm. Por pasi që emocionet janë subjektive, annotimi i zërit është një detyrë e komplikuar. Ne do të përdorim funksionet mfcc, chroma dhe mel dhe do të përdorim setin e të dhënave RAVDESS për njohjen e emocioneve. Ne do të krijojmë një klasifikues MLPC për këtë model.
Gjuha: Python
Seti i të dhënave/Paketa: Seti i të dhënave RAVDESS
5. Zbulimi i Gjenit dhe Moshës (Gender and Age Detection)
Impononi punĂ«dhĂ«nĂ«sit me projektin mĂ« tĂ« ri nĂ« shkencat e tĂ« dhĂ«nave â .

Ky është një projekt interesante në shkencat e të dhënave me Python. Duke përdorur vetëm një imazh, do të mësoni të parashikoni gjenin dhe moshën e një personi. Në këtë projekt, do t'ju njohim me vizionin kompjuterik (Computer Vision) dhe parimet e tij. Ne do të ndërtojmë dhe do të përdorim modelet e trenuara nga Tal Hassner dhe Gil Levi për setin e të dhënave Adience. Gjatë kësaj rruge, do të përdorim disa skedarë .pb, .pbtxt, .prototxt dhe .caffemodel.
Gjuha: Python
Seti i të dhënave/Paketa: Adience
6. Analiza e të Dhënave të Uber (Uber Data Analysis)
Shihni implementimin e plotĂ« tĂ« projektit tĂ« shkencave tĂ« tĂ« dhĂ«nave me kod burimor â .

Ky projekt është një vizualizim të dhënash me ggplot2, ku ne do të përdorim R dhe bibliotekat e tij për të analizuar parametra të ndryshëm. Ne do të përdorim setin e të dhënave Uber Pickups në New York dhe do të krijojmë vizualizime për kuadro të ndryshme të vitit. Kjo na tregon se si koha ndikon në udhëtimet e klientëve.
Gjuha: R
Seti i të dhënave/Paketa: Seti i të dhënave Uber Pickups në New York City
7. Zbulimi i Gjumit te Shoferëve (Driver Drowsiness Detection)
PĂ«rmirĂ«soni aftĂ«sitĂ« tuaja duke punuar nĂ« projektin kryesor tĂ« shkencave tĂ« tĂ« dhĂ«nave â .

Gjumia gjatë drejtimit është jashtëzakonisht e rrezikshme, dhe çdo vit ndodhin rreth një mijë aksidente për shkak se shoferët bien në gjumë gjatë drejtimit. Në këtë projekt me Python, ne do të krijojmë një sistem që do të jetë në gjendje të zbulojë shoferët e gjumitur dhe t'i njoftojë ata me një sinjal zëri.
Ky ky projekt është realizuar duke përdorur Keras dhe OpenCV. Ne do të përdorim OpenCV për të identifikuar fytyrën dhe sytë, dhe me Keras do të klasifikojmë gjendjen e syrit (Të Hapura ose Të Mbyllura) duke përdorur metoda të rrjeteve neuronale të thella.
8. Chatbot
Krijoni njĂ« chatbot me Python dhe bĂ«ni njĂ« hap pĂ«rpara nĂ« karrierĂ«n tuaj â .

ChatbotĂ«t janĂ« njĂ« pjesĂ« e pamundur e biznesit. ShumĂ« biznese duhet tĂ« ofrojnĂ« shĂ«rbime pĂ«r klientĂ«t e tyre, dhe pĂ«r tĂ« mbĂ«shtetur kĂ«tĂ« kĂ«rkohet shumĂ« forcĂ« pune, kohĂ« dhe pĂ«rpjekje. ChatbotĂ«t mund tĂ« automatizojnĂ« njĂ« pjesĂ« tĂ« madhe tĂ« ndĂ«rveprimit me klientĂ«t, duke u pĂ«rgjigjur disa pyetjeve tĂ« shpeshta qĂ« bĂ«jnĂ« klientĂ«t. NĂ« thelb ka dy lloje chatbot-Ă«sh: Domain-specific dhe Open-domain. ChatbotĂ«t Domain-specific pĂ«rdoren shpesh pĂ«r tĂ« zgjidhur njĂ« problem specifik. Prandaj, ju duhet ta konfiguroni atĂ« pĂ«r tĂ« punuar nĂ« mĂ«nyrĂ« efektive nĂ« fushĂ«n tuaj. ChatbotĂ«t Open-domain mund tâu bĂ«jnĂ« çdo lloj pyetje, prandaj pĂ«r trajnimin e tyre kĂ«rkohet njĂ« sasi e madhe tĂ« dhĂ«nash.
Grupi i të dhënave: Skedari intents json
Gjuha: Python
Projekte të avancuara të Shkencës së të Dhënave
9. Gjeneratori i përshkrimeve të imazheve
Kontrolloni realizimin e plotĂ« tĂ« projektit me kodin burimor â .

Përshkrimi i asaj që ndodhet në një imazh është një detyrë e lehtë për njerëzit, por për kompjuterët, imazhi është thjesht një grup numrash që përfaqësojnë vlerën e ngjyrës për secilin piksel. Kjo është një detyrë e vështirë për kompjuterët. Të kuptosh se çfarë ndodhet në një imazh dhe më pas të krijosh një përshkrim në një gjuhë natyrore (për shembull, në anglisht) është një tjetër detyrë e vështirë. Ky projekt përdor metoda të mësimit të thellë, ku ne zbatojmë një Rrëke Neurale Konvolucionale (CNN) me një Rrëke Neurale Recurrente (LSTM) për të krijuar një gjenerator përshkrimesh për imazhe.
Grupi i të dhënave: Flickr 8K
Gjuha: Python
Framework: Keras
10. Identifikimi i Mashtrimit me Kartat e Kreditit
BĂ«ni gjithçka qĂ« Ă«shtĂ« e mundur duke punuar mbi idenĂ« e projektit tĂ« ShkencĂ«s sĂ« tĂ« DhĂ«nave â .

Derisa të arritni tani, ju keni filluar të kuptoni metodat dhe konceptet. Le të kalojmë në disa projekte të avancuara në shkencën e të dhënave. Në këtë projekt, ne do të përdorim gjuhën R me algoritma të tillë si , regresioni logjistik, rrjetet neurale artificiale dhe klasifikuesi i fuqisë gradienti. Ne do të përdorim një grup të dhënash për transaksionet me karta, për të klasifikuar transaksionet e kartave të kreditit si mashtruese dhe të vërteta. Ne do t'i përshtatim atyre modele të ndryshme dhe do të ndjekim kurbat e performancës.
Gjuha: R
Seti i të dhënave/Paketa: Grupi i të dhënave për Transaksionet me Karta
11. Sistemi i Rekomandimeve për Filma
Studio realizimin e projektit mĂ« tĂ« mirĂ« tĂ« Data Science me Kodin Burimor â

NĂ« kĂ«tĂ« projekt tĂ« Data Science, ne do tĂ« pĂ«rdorim R pĂ«r tĂ« ofruar rekomandime filmash pĂ«rmes mĂ«simit tĂ« makinerive. Sistemi i rekomandimeve dĂ«rgon sugjerime pĂ«rdoruesve pĂ«rmes njĂ« procesi filtrimi, tĂ« bazuar nĂ« preferencat e pĂ«rdoruesve tĂ« tjerĂ« dhe historinĂ« e shikimeve. NĂ«se A dhe B i pĂ«lqen Home Alone, dhe B e do Mean Girls, atĂ«herĂ« mund t'i sugjerohet A â ata gjithashtu mund t'i pĂ«lqejnĂ«. Kjo lejon klientĂ«t tĂ« interaktin me platformĂ«n.
Gjuha: R
Seti i të dhënave/Paketa: Grupi i të dhënave të MovieLens
12. Segmentimi i Klientëve
BĂ«ni njĂ« pĂ«rshtypje tek punĂ«dhĂ«nĂ«sit me projektin e Data Science (duke pĂ«rfshirĂ« kodin burimor) â .

Segmentimi i klientëve është një aplikacion popullor Duke përdorur klasterizimin, kompanitë përcaktojnë segmente klientësh për të punuar me bazën e potenciale të përdoruesve. Ato ndajnë klientët në grupe sipas karakteristikave të zakonshme, si gjinia, mosha, interesat dhe zakonet e shpenzimit, në mënyrë që të mund të shesin produktet e tyre me efikasitet për çdo grup. Ne do të përdorim , si dhe do të vizualizojmë shpërndarjen sipas gjinive dhe moshës. Më pas do të analizojmë të ardhurat vjetore dhe nivelin e shpenzimeve të tyre.
Gjuha: R
Seti i të dhënave/Paketa: Grupi i të dhënave të Mall_Customers
13. Klasifikimi i Kancerit të Gjirit
Shikoni realizimin e plotĂ« tĂ« projektit tĂ« Data Science nĂ« Python â .

Duke u kthyer në kontributin mjekësor të shkencave të dhënave, le të mësojmë të identifikojmë kancerin e gjirit me ndihmën e Python. Ne do të përdorim setin e të dhënave IDC_regular për të identifikuar karcinomën invazive të kanaleve, formën më të zakonshme të kancerit të gjirit. Ai zhvillohet në kanalet e gjirit, duke u përhapur në indin fibror ose yndyror të gjirit përtej kanalit. Në këtë ide të projektit shkencor për mbledhjen e të dhënave do të përdorim dhe bibliotekën Keras për klasifikim.
Gjuha: Python
Seti i të dhënave/Paketa: IDC_regular
14. Njohja e Shenjave Trafiku
Arritja e saktësisë në teknologjinë e vetë-ndihmës për vozitjen e automjeteve përmes një projekti Shkencë të Dhënash për me burim të hapur.

Shenjat e trafikut dhe rregullat e qarkullimit janĂ« shumĂ« tĂ« rĂ«ndĂ«sishme pĂ«r çdo vozitĂ«s pĂ«r tĂ« shmangur aksidentet. PĂ«r tĂ« ndjekur rregullin, fillimisht duhet tĂ« kuptohet se si duket njĂ« shenjĂ« trafiku. NjerĂ«zit duhet tĂ« mĂ«sojnĂ« tĂ« gjitha shenjat e trafikut pĂ«rpara se t'u jepet leja pĂ«r tĂ« drejtuar ndonjĂ« mjet. Por tani numri i automjeteve autonome po rritet, dhe nĂ« tĂ« ardhmen e afĂ«rt njerĂ«zit ndoshta nuk do tĂ« drejtojnĂ« makinĂ«n mĂ« vetĂ«. NĂ« projektin âNjohja e Shenjave Trafikutâ do tĂ« mĂ«soni si njĂ« program mund tĂ« identifikojĂ« llojin e shenjave tĂ« trafikut duke pranuar njĂ« imazh si hyrje. Seti i tĂ« dhĂ«nave pĂ«r njohjen e shenjave tĂ« trafikut nĂ« Gjermani (GTSRB) pĂ«rdoret pĂ«r tĂ« ndĂ«rtuar njĂ« rrjet tĂ« thellĂ« nervor pĂ«r tĂ« njohur klasĂ«n e shenjĂ«s sĂ« trafikut. Ne gjithashtu krijojmĂ« njĂ« ndĂ«rfaqe grafike tĂ« thjeshtĂ« pĂ«r ndĂ«rveprimin me aplikacionin.
Gjuha: Python
Grupi i të dhënave: GTSRB (Benchmark për Njohjen e Shenjave të Trafikut në Gjermani)
Lexo më shumë
Burimi: habr.com
