Data Science për fillestarët
1. Analiza e Ndjenjave (Analiza e ndjenjave përmes tekstit)

Shikoni implementimin e plotĂ« tĂ« projektit Data Science me pĂ«rdorimin e kodit burim â .
Analiza e Ndjenjave Ă«shtĂ« analiza e fjalĂ«ve pĂ«r tĂ« pĂ«rcaktuar ndjenjat dhe opinionet, tĂ« cilat mund tĂ« jenĂ« pozitive ose negative. Ky Ă«shtĂ« njĂ« tip klasifikimi, ku klasat mund tĂ« jenĂ« binar (pozitive dhe negative) ose multipel (tĂ« lumtur, tĂ« zemĂ«ruar, tĂ« trishtuar, tĂ« pakĂ«ndshĂ«m âŠ). Ne do ta realizojmĂ« kĂ«tĂ« projekt Data Science nĂ« gjuhĂ«n R dhe do tĂ« pĂ«rdorim njĂ« grup tĂ« dhĂ«nash nga paketa 'janeaustenR'. Do tĂ« pĂ«rdorim fjalorĂ« tĂ« pĂ«rgjithshĂ«m, si AFINN, bing dhe loughran, do tĂ« kryejmĂ« bashkimin e brendshĂ«m, dhe nĂ« fund do tĂ« krijojmĂ« njĂ« re fjalĂ«sh pĂ«r tĂ« ilustruar rezultatin.
Gjuha: R
Grupi i të dhënave/Paketa: janeaustenR
Artikulli është përkthyer me mbështetje nga kompania EDISON Software, e cila , si dhe .
2. Zbulimi i Fake News (Zbulimi i lajmeve false)
Ă elevoni aftĂ«sitĂ« tuaja nĂ« njĂ« nivel tĂ« ri duke punuar nĂ« njĂ« projekt pĂ«r Data Science pĂ«r fillestarĂ«t â .

Lajmet e rreme janë informacion i rremë që përhapet përmes mediave sociale dhe burimeve të tjera për arritjen e qëllimeve politike. Në këtë ide projekti për Data Science, ne do të përdorim Python për të ndërtuar një model që mund të përcaktojë saktësisht nëse një lajm është i vërtetë apo i rremë. Ne do të krijojmë TfidfVectorizer dhe do të përdorim PassiveAggressiveClassifier për të klasifikuar lajmet si "të vërteta" ose "të rreme". Ne do të përdorim një grup të dhënash me formën 7796 à 4 dhe do të realizojmë gjithçka në Jupyter Lab.
Gjuha: Python
Grupi i të dhënave/Paketa: news.csv
3. Identifikimi i Sëmundjes së Parkinsonit
Shkoni përpara duke punuar në idenë e projektit Data Science - .

Kemi filluar tĂ« pĂ«rdorim ShkencĂ«n e TĂ« DhĂ«nave pĂ«r tĂ« pĂ«rmirĂ«suar shĂ«ndetĂ«sinĂ« dhe shĂ«rbimet â nĂ«se mund tĂ« parashikojmĂ« sĂ«mundjen nĂ« fazat e para, do tĂ« kemi shumĂ« pĂ«rfitime. Prandaj, nĂ« kĂ«tĂ« ide projekti pĂ«r ShkencĂ«n e TĂ« DhĂ«nave do tĂ« mĂ«sojmĂ« si tĂ« identifikojmĂ« sĂ«mundjen e Parkinsonit duke pĂ«rdorur Python. Kjo Ă«shtĂ« njĂ« sĂ«mundje neurodegjenerative, progresive e sistemit nervor qendror, e cila ndikon nĂ« lĂ«vizje dhe shkakton dridhje dhe ngurtĂ«si. Ajo ndikon te neuronet qĂ« prodhojnĂ« dopaminĂ« nĂ« tru, dhe çdo vit, ajo prek mĂ« shumĂ« se 1 milion njerĂ«z nĂ« Indi.
Gjuha: Python
Grupi i të dhënave/Paketa: UCI ML Parkinsons dataset
Projekte të Shkencës së Të Dhënave me vështirësi të mesme
4. Njohja e Emocioneve në Fjalë (Speech Emotion Recognition)
Shikoni realizimin e plotĂ« tĂ« shembujve tĂ« projekteve tĂ« ShkencĂ«s sĂ« TĂ« DhĂ«nave â .

Tani le tĂ« mĂ«sojmĂ« tĂ« pĂ«rdorim biblioteka tĂ« ndryshme. Ky projekt nĂ« Data Science pĂ«rdor librosa pĂ«r njohjen e zĂ«rit. SERâa Ă«shtĂ« procesi i identifikimit tĂ« emocioneve njerĂ«zore dhe gjendjeve affective pĂ«rmes zĂ«rit. Duke qenĂ« se ne pĂ«rdorim tonin dhe lartĂ«sinĂ« e tonit pĂ«r tĂ« shprehur emocionet me zĂ«, SER Ă«shtĂ« nĂ« raund. Por, pasi emocionet janĂ« subjektive, annotimi i tingujve Ă«shtĂ« njĂ« detyrĂ« e komplikuar. Ne do tĂ« pĂ«rdorim funksionet mfcc, chroma dhe mel dhe do tĂ« pĂ«rdorim setin e tĂ« dhĂ«nave RAVDESS pĂ«r njohjen e emocioneve. Ne do tĂ« krijojmĂ« njĂ« klasifikues MLPC pĂ«r kĂ«tĂ« model.
Gjuha: Python
Grupi i të dhënave/Paketa: RAVDESS dataset
5. Gender and Age Detection (Detektimi i Gjinisë dhe Moshës)
Merrni vĂ«mendjen e punĂ«dhĂ«nĂ«sve me projektin mĂ« tĂ« ri nĂ« Data Science â .

Ky Ă«shtĂ« njĂ« projekt interesant Data Science me Python. Duke pĂ«rdorur vetĂ«m njĂ« imazh, do tĂ« mĂ«soni tĂ« parashikoni gjininĂ« dhe moshĂ«n e njĂ« personi. NĂ« kĂ«tĂ« projekt do tâju prezantojmĂ« me Computer Vision dhe principet e tij. Ne do tĂ« ndĂ«rtojmĂ« dhe do tĂ« pĂ«rdorim modelet e trajnuara nga Tal Hassner dhe Gil Levi pĂ«r setin e tĂ« dhĂ«nave Adience. GjatĂ« rrugĂ«s do tĂ« pĂ«rdorim disa skedarĂ« .pb, .pbtxt, .prototxt dhe .caffemodel.
Gjuha: Python
Grupi i të dhënave/Paketa: Adience
6. Uber Data Analysis (Analiza e të Dhënave të Uberit)
Shikoni realizimin e plotĂ« tĂ« projektit Data Science me kodin burimor â .

Ky është një projekt vizualizimi të dhënash me ggplot2, në të cilin do të përdorim R dhe bibliotekat e tij për të analizuar parametrat e ndryshëm. Do të përdorim setin e të dhënave Uber Pickups në New York dhe do të krijojmë vizualizime për periudha të ndryshme të vitit. Kjo na tregon se si koha ndikon në udhëtimet e klientëve.
Gjuha: R
Grupi i të dhënave/Paketa: Dataset-i Uber Pickups në qytetin e New York-ut
7. Zbulimi i dueriz si rezultat i lodhjes (Driver Drowsiness detection)
PĂ«rmirĂ«soni aftĂ«sitĂ« tuaja duke punuar nĂ« njĂ« projekt tĂ« lartĂ« tĂ« Data Science â .

TĂ« drejtuarit nĂ« gjumĂ« Ă«shtĂ« jashtĂ«zakonisht e rrezikshme, dhe çdo vit ndodhin rreth njĂ« mijĂ« aksidente pĂ«r shkak se shoferĂ«t bien nĂ« gjumĂ« gjatĂ« drejtimit. NĂ« kĂ«tĂ« projekt nĂ« Python, ne do tĂ« krijojmĂ« njĂ« sistem qĂ« mund tĂ« zbulojĂ« shoferĂ« tĂ« lodhur dhe tâi paralajmĂ«rojĂ« ata me njĂ« sinjal akustik.
Ky projekt është realizuar duke përdorur Keras dhe OpenCV. Ne do të përdorim OpenCV për zbulimin e fytyrës dhe syve, dhe me Keras ne do të klasifikojmë gjendjen e syve (Të hapur ose Të mbyllur) duke përdorur metoda të rrjeteve nervore të thella.
8. Chatbot
Krijoni njĂ« chatbot me Python dhe bĂ«ni njĂ« hap pĂ«rpara nĂ« karrierĂ«n tuaj â .

ChatbotĂ«t janĂ« njĂ« pjesĂ« e pandashme e biznesit. ShumĂ« ndĂ«rmarrje duhet tĂ« ofrojnĂ« shĂ«rbime pĂ«r klientĂ«t e tyre, dhe pĂ«r tâi shĂ«rbyer atyre kĂ«rkohet shumĂ« punĂ«, kohĂ« dhe pĂ«rpjekje. ChatbotĂ«t mund tĂ« automatizojnĂ« njĂ« pjesĂ« tĂ« madhe tĂ« ndĂ«rveprimit me klientĂ«t, duke u pĂ«rgjigjur nĂ« disa pyetje tĂ« shpeshta qĂ« bĂ«jnĂ« klientĂ«t. NĂ« thelb, ka dy lloje chatbot-Ă«sh: Domain-specific dhe Open-domain. ChatbotĂ«t Domain-specific pĂ«rdoren shpesh pĂ«r tĂ« zgjidhur njĂ« problem tĂ« caktuar. KĂ«shtu, ju duhet ta pĂ«rshtatni atĂ« pĂ«r tĂ« funksionuar nĂ« mĂ«nyrĂ« efektive nĂ« sektorin tuaj. ChatbotĂ«t Open-domain mund t'u bĂ«hen çdo pyetje, prandaj kĂ«rkojnĂ« njĂ« masĂ« tĂ« madhe tĂ« dhĂ«nash pĂ«r t'u trajnuar.
Grupi i të dhënave: Skedari json për Intentet
Gjuha: Python
Projekte të avancuara të Shkencës së të Dhënave
9. Gjeneratori i përshkrimeve të imazheve
Kontrolloni realizimin e plotĂ« tĂ« projektit me kodin burimor â .

Përshkrimi i asaj që është në imazh është një detyrë e lehtë për njerëzit, por për kompjuterët, imazhi është thjesht një grup numrash që përfaqësojnë vlerën e ngjyrës së secilit pixel. Kjo është një detyrë e vështirë për kompjuterët. Të kuptosh atë që ndodhet në imazh dhe pastaj të krijosh një përshkrim në një gjuhë natyrale (për shembull, anglisht) është një detyrë tjetër e vështirë. Ky projekt përdor metoda të mësimit të thellë, në të cilat ne implementojmë një Rrjet Neuronal Konvolucional (CNN) me një Rrjet Neuronal Rekurent (LSTM) për të krijuar një gjenerator përshkrimesh për imazhe.
Grupi i të dhënave: Flickr 8K
Gjuha: Python
Korniza: Keras
10. Zbulesa e Mashtrimit të Kartave të Kreditit
BĂ«ni maksimumin duke punuar nĂ« idenĂ« e projektit Data Science â .

Derisa të arrini këtë pikë, keni filluar të kuptoni metodat dhe konceptet. Le të kalojmë në disa projekte më të avancuara në fushën e shkencave të të dhënave. Në këtë projekt do të përdorim gjuhën R me algoritme të tillë si , regresioni logjistik, rrjetet nervore të artificiale dhe klasifikuesi i përmirësimit të gradientit. Ne do të përdorim një set të dhënash të transaksioneve me karta për të klasifikuar transaksionet e kartave të kreditit si mashtruese ose të vërteta. Ne do të zgjidhim modele të ndryshme dhe do të ndërtojmë kurba performancës.
Gjuha: R
Grupi i të dhënave/Paketa: Seti i të dhënave të Transaksioneve me Karta
11. Sistema i rekomandimeve për filma
Eksploroni realizimin e projektit mĂ« tĂ« mirĂ« tĂ« ShkencĂ«s sĂ« tĂ« DhĂ«nave me Kodin Burimor â

NĂ« kĂ«tĂ« projekt tĂ« ShkencĂ«s sĂ« tĂ« DhĂ«nave, ne do tĂ« pĂ«rdorim R pĂ«r tĂ« realizuar rekomandimet pĂ«r filma pĂ«rmes mĂ«simit tĂ« makinerive. Sistemi i rekomandimeve dĂ«rgon sugjerime pĂ«rdoruesve pĂ«rmes njĂ« procesi filtrimi, duke u bazuar nĂ« preferencat e pĂ«rdoruesve tĂ« tjerĂ« dhe historinĂ« e shikimeve. NĂ«se A dhe B e pĂ«lqejnĂ« Home Alone, dhe B e do Mean Girls, mund t'i sugjerohet A â mund t'i pĂ«lqejĂ« edhe atij. Kjo lejon qĂ« klientĂ«t tĂ« ndĂ«rveprojnĂ« me platformĂ«n.
Gjuha: R
Grupi i të dhënave/Paketa: Seti i të dhënave MovieLens
12. Segmente të klientëve
BĂ«ni pĂ«rshtypje tĂ« punĂ«dhĂ«nĂ«sve me ndihmĂ«n e projektit tĂ« ShkencĂ«s sĂ« tĂ« DhĂ«nave (duke pĂ«rfshirĂ« kodin burimor) â .

Segmentimi i blerësve është një aplikacion popullor . Duke përdorur grupimin, kompanitë përcaktojnë segmentet e klientëve për të punuar me një bazë të mundshme përdoruesish. Ato ndajnë klientët në grupe sipas karakteristikave të përbashkëta, siç janë gjinia, mosha, interesat dhe zakonet e shpenzimit, në mënyrë që të mund të shesin produktet e tyre në mënyrë efikase për çdo grup. Ne do të përdorim , si dhe të visualizojmë shpërndarjen sipas gjinisë dhe moshës. Më pas do të analizojmë të ardhurat e tyre vjetore dhe nivelin e shpenzimeve.
Gjuha: R
Grupi i të dhënave/Paketa: datasetin Mall_Customers
13. Klassifikimi i Kancerit të Gjirit
Shikoni realizimin e plotĂ« tĂ« projektit tĂ« ShkencĂ«s sĂ« tĂ« DhĂ«nave nĂ« Python â .

Duke u kthyer te kontributi mjekësor i shkencës së të dhënave, le të mësojmë të identifikojmë kancerin e gjirit duke përdorur Python. Ne do të përdorim setin e të dhënave IDC_regular për të identifikuar karcinomën invazive të kanaleve, lloji më i zakonshëm i kancerit të gjirit. Ai zhvillohet në kanalet e qumështit, duke depërtuar në indet fibrilare ose yndyrore të gjirit nga jashtë kanalit. Në këtë projekt shkencor të mbledhjes së të dhënave ne do të përdorim dhe bibliotekën Keras për klasifikim.
Gjuha: Python
Grupi i të dhënave/Paketa: IDC_regular
14. Traffic Signs Recognition (NJohja e Shenjave Rrugore)
Arritja e saktësisë në teknologjinë e drejtimit të automjeteve me projektin e shkencës së të dhënave për me kod të hapur.

Tabelat e trafikut dhe rregullat e qarkullimit janĂ« shumĂ« tĂ« rĂ«ndĂ«sishme pĂ«r çdo shofer pĂ«r tĂ« shmangur aksidentet. PĂ«r tĂ« respektuar rregullin, sĂ« pari duhet tĂ« kuptohet si duket njĂ« tabelĂ« e trafikut. NjĂ«ri duhet tĂ« mĂ«sojĂ« tĂ« gjitha tabelat e trafikut para se t'i jepet leja pĂ«r tĂ« drejtuar ndonjĂ« mjet. Por tani numri i mjeteve autonome Ă«shtĂ« nĂ« rritje dhe nĂ« tĂ« ardhmen tĂ« ardhmen, njeriu nuk do tĂ« drejtojĂ« mĂ« vetĂ« makinĂ«n. NĂ« projektin âNjohja e Tabelave tĂ« Trafikutâ do tĂ« mĂ«soni si programi mund tĂ« njohĂ« llojin e tabelave tĂ« trafikut duke marrĂ« imazhin si hyrje. Grupi i tĂ« dhĂ«nave pĂ«r njohjen e tabelave tĂ« trafikut nĂ« Gjermani (GTSRB) pĂ«rdoret pĂ«r ndĂ«rtimin e njĂ« rrjeti nervor tĂ« thellĂ« pĂ«r tĂ« njohur klasĂ«n nĂ« tĂ« cilĂ«n pĂ«rket tabela e trafikut. Ne gjithashtu po krijojmĂ« njĂ« ndĂ«rfaqe grafike tĂ« thjeshtĂ« pĂ«r ndĂ«rveprimin me aplikacionin.
Gjuha: Python
Grupi i të dhënave: GTSRB (German Traffic Sign Recognition Benchmark)
Lexoni më shumë
Burimi: habr.com
