14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

Data Science për fillestarët

1. Analiza e Ndjenjave (Analiza e ndjenjave përmes tekstit)

14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

Shikoni implementimin e plotĂ« tĂ« projektit Data Science me pĂ«rdorimin e kodit burim — Projekti i AnalizĂ«s sĂ« Ndjenjave nĂ« R.

Analiza e Ndjenjave është analiza e fjalëve për të përcaktuar ndjenjat dhe opinionet, të cilat mund të jenë pozitive ose negative. Ky është një tip klasifikimi, ku klasat mund të jenë binar (pozitive dhe negative) ose multipel (të lumtur, të zemëruar, të trishtuar, të pakëndshëm 
). Ne do ta realizojmë këtë projekt Data Science në gjuhën R dhe do të përdorim një grup të dhënash nga paketa 'janeaustenR'. Do të përdorim fjalorë të përgjithshëm, si AFINN, bing dhe loughran, do të kryejmë bashkimin e brendshëm, dhe në fund do të krijojmë një re fjalësh për të ilustruar rezultatin.

Gjuha: R
Grupi i të dhënave/Paketa: janeaustenR

14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

Artikulli është përkthyer me mbështetje nga kompania EDISON Software, e cila krijon dhoma provimi virtuale për dyqanet me shumë marka, si dhe teston softuerin.

2. Zbulimi i Fake News (Zbulimi i lajmeve false)

Ç elevoni aftĂ«sitĂ« tuaja nĂ« njĂ« nivel tĂ« ri duke punuar nĂ« njĂ« projekt pĂ«r Data Science pĂ«r fillestarĂ«t — identifikimi i lajmeve tĂ« rreme me Python.

14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

Lajmet e rreme janĂ« informacion i rremĂ« qĂ« pĂ«rhapet pĂ«rmes mediave sociale dhe burimeve tĂ« tjera pĂ«r arritjen e qĂ«llimeve politike. NĂ« kĂ«tĂ« ide projekti pĂ«r Data Science, ne do tĂ« pĂ«rdorim Python pĂ«r tĂ« ndĂ«rtuar njĂ« model qĂ« mund tĂ« pĂ«rcaktojĂ« saktĂ«sisht nĂ«se njĂ« lajm Ă«shtĂ« i vĂ«rtetĂ« apo i rremĂ«. Ne do tĂ« krijojmĂ« TfidfVectorizer dhe do tĂ« pĂ«rdorim PassiveAggressiveClassifier pĂ«r tĂ« klasifikuar lajmet si "tĂ« vĂ«rteta" ose "tĂ« rreme". Ne do tĂ« pĂ«rdorim njĂ« grup tĂ« dhĂ«nash me formĂ«n 7796 × 4 dhe do tĂ« realizojmĂ« gjithçka nĂ« Jupyter Lab.

Gjuha: Python

Grupi i të dhënave/Paketa: news.csv

3. Identifikimi i Sëmundjes së Parkinsonit

Shkoni përpara duke punuar në idenë e projektit Data Science - identifikimi i sëmundjes së Parkinsonit me XGBoost.

14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

Kemi filluar tĂ« pĂ«rdorim ShkencĂ«n e TĂ« DhĂ«nave pĂ«r tĂ« pĂ«rmirĂ«suar shĂ«ndetĂ«sinĂ« dhe shĂ«rbimet — nĂ«se mund tĂ« parashikojmĂ« sĂ«mundjen nĂ« fazat e para, do tĂ« kemi shumĂ« pĂ«rfitime. Prandaj, nĂ« kĂ«tĂ« ide projekti pĂ«r ShkencĂ«n e TĂ« DhĂ«nave do tĂ« mĂ«sojmĂ« si tĂ« identifikojmĂ« sĂ«mundjen e Parkinsonit duke pĂ«rdorur Python. Kjo Ă«shtĂ« njĂ« sĂ«mundje neurodegjenerative, progresive e sistemit nervor qendror, e cila ndikon nĂ« lĂ«vizje dhe shkakton dridhje dhe ngurtĂ«si. Ajo ndikon te neuronet qĂ« prodhojnĂ« dopaminĂ« nĂ« tru, dhe çdo vit, ajo prek mĂ« shumĂ« se 1 milion njerĂ«z nĂ« Indi.

Gjuha: Python

Grupi i të dhënave/Paketa: UCI ML Parkinsons dataset

Projekte të Shkencës së Të Dhënave me vështirësi të mesme

4. Njohja e Emocioneve në Fjalë (Speech Emotion Recognition)

Shikoni realizimin e plotĂ« tĂ« shembujve tĂ« projekteve tĂ« ShkencĂ«s sĂ« TĂ« DhĂ«nave — njohja e fjalĂ«s me Librosa.

14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

Tani le tĂ« mĂ«sojmĂ« tĂ« pĂ«rdorim biblioteka tĂ« ndryshme. Ky projekt nĂ« Data Science pĂ«rdor librosa pĂ«r njohjen e zĂ«rit. SER—a Ă«shtĂ« procesi i identifikimit tĂ« emocioneve njerĂ«zore dhe gjendjeve affective pĂ«rmes zĂ«rit. Duke qenĂ« se ne pĂ«rdorim tonin dhe lartĂ«sinĂ« e tonit pĂ«r tĂ« shprehur emocionet me zĂ«, SER Ă«shtĂ« nĂ« raund. Por, pasi emocionet janĂ« subjektive, annotimi i tingujve Ă«shtĂ« njĂ« detyrĂ« e komplikuar. Ne do tĂ« pĂ«rdorim funksionet mfcc, chroma dhe mel dhe do tĂ« pĂ«rdorim setin e tĂ« dhĂ«nave RAVDESS pĂ«r njohjen e emocioneve. Ne do tĂ« krijojmĂ« njĂ« klasifikues MLPC pĂ«r kĂ«tĂ« model.

Gjuha: Python

Grupi i të dhënave/Paketa: RAVDESS dataset

5. Gender and Age Detection (Detektimi i Gjinisë dhe Moshës)

Merrni vĂ«mendjen e punĂ«dhĂ«nĂ«sve me projektin mĂ« tĂ« ri nĂ« Data Science — detektimi i gjinisĂ« dhe moshĂ«s me OpenCV.

14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

Ky Ă«shtĂ« njĂ« projekt interesant Data Science me Python. Duke pĂ«rdorur vetĂ«m njĂ« imazh, do tĂ« mĂ«soni tĂ« parashikoni gjininĂ« dhe moshĂ«n e njĂ« personi. NĂ« kĂ«tĂ« projekt do t’ju prezantojmĂ« me Computer Vision dhe principet e tij. Ne do tĂ« ndĂ«rtojmĂ« njĂ« rrjet nervor konvolucional dhe do tĂ« pĂ«rdorim modelet e trajnuara nga Tal Hassner dhe Gil Levi pĂ«r setin e tĂ« dhĂ«nave Adience. GjatĂ« rrugĂ«s do tĂ« pĂ«rdorim disa skedarĂ« .pb, .pbtxt, .prototxt dhe .caffemodel.

Gjuha: Python

Grupi i të dhënave/Paketa: Adience

6. Uber Data Analysis (Analiza e të Dhënave të Uberit)

Shikoni realizimin e plotĂ« tĂ« projektit Data Science me kodin burimor — Projekti i AnalizĂ«s sĂ« Uber nĂ« R.

14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

Ky është një projekt vizualizimi të dhënash me ggplot2, në të cilin do të përdorim R dhe bibliotekat e tij për të analizuar parametrat e ndryshëm. Do të përdorim setin e të dhënave Uber Pickups në New York dhe do të krijojmë vizualizime për periudha të ndryshme të vitit. Kjo na tregon se si koha ndikon në udhëtimet e klientëve.

Gjuha: R

Grupi i të dhënave/Paketa: Dataset-i Uber Pickups në qytetin e New York-ut

7. Zbulimi i dueriz si rezultat i lodhjes (Driver Drowsiness detection)

PĂ«rmirĂ«soni aftĂ«sitĂ« tuaja duke punuar nĂ« njĂ« projekt tĂ« lartĂ« tĂ« Data Science — njĂ« sistem zbulimi lodhjeje me OpenCV & Keras.

14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

TĂ« drejtuarit nĂ« gjumĂ« Ă«shtĂ« jashtĂ«zakonisht e rrezikshme, dhe çdo vit ndodhin rreth njĂ« mijĂ« aksidente pĂ«r shkak se shoferĂ«t bien nĂ« gjumĂ« gjatĂ« drejtimit. NĂ« kĂ«tĂ« projekt nĂ« Python, ne do tĂ« krijojmĂ« njĂ« sistem qĂ« mund tĂ« zbulojĂ« shoferĂ« tĂ« lodhur dhe t’i paralajmĂ«rojĂ« ata me njĂ« sinjal akustik.

Ky projekt është realizuar duke përdorur Keras dhe OpenCV. Ne do të përdorim OpenCV për zbulimin e fytyrës dhe syve, dhe me Keras ne do të klasifikojmë gjendjen e syve (Të hapur ose Të mbyllur) duke përdorur metoda të rrjeteve nervore të thella.

8. Chatbot

Krijoni njĂ« chatbot me Python dhe bĂ«ni njĂ« hap pĂ«rpara nĂ« karrierĂ«n tuaj — Chatbot me NLTK & Keras.

14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

ChatbotĂ«t janĂ« njĂ« pjesĂ« e pandashme e biznesit. ShumĂ« ndĂ«rmarrje duhet tĂ« ofrojnĂ« shĂ«rbime pĂ«r klientĂ«t e tyre, dhe pĂ«r t’i shĂ«rbyer atyre kĂ«rkohet shumĂ« punĂ«, kohĂ« dhe pĂ«rpjekje. ChatbotĂ«t mund tĂ« automatizojnĂ« njĂ« pjesĂ« tĂ« madhe tĂ« ndĂ«rveprimit me klientĂ«t, duke u pĂ«rgjigjur nĂ« disa pyetje tĂ« shpeshta qĂ« bĂ«jnĂ« klientĂ«t. NĂ« thelb, ka dy lloje chatbot-Ă«sh: Domain-specific dhe Open-domain. ChatbotĂ«t Domain-specific pĂ«rdoren shpesh pĂ«r tĂ« zgjidhur njĂ« problem tĂ« caktuar. KĂ«shtu, ju duhet ta pĂ«rshtatni atĂ« pĂ«r tĂ« funksionuar nĂ« mĂ«nyrĂ« efektive nĂ« sektorin tuaj. ChatbotĂ«t Open-domain mund t'u bĂ«hen çdo pyetje, prandaj kĂ«rkojnĂ« njĂ« masĂ« tĂ« madhe tĂ« dhĂ«nash pĂ«r t'u trajnuar.

Grupi i të dhënave: Skedari json për Intentet

Gjuha: Python

Projekte të avancuara të Shkencës së të Dhënave

9. Gjeneratori i përshkrimeve të imazheve

Kontrolloni realizimin e plotĂ« tĂ« projektit me kodin burimor — Gjeneratori i pĂ«rshkrimeve tĂ« imazheve me CNN & LSTM.

14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

Përshkrimi i asaj që është në imazh është një detyrë e lehtë për njerëzit, por për kompjuterët, imazhi është thjesht një grup numrash që përfaqësojnë vlerën e ngjyrës së secilit pixel. Kjo është një detyrë e vështirë për kompjuterët. Të kuptosh atë që ndodhet në imazh dhe pastaj të krijosh një përshkrim në një gjuhë natyrale (për shembull, anglisht) është një detyrë tjetër e vështirë. Ky projekt përdor metoda të mësimit të thellë, në të cilat ne implementojmë një Rrjet Neuronal Konvolucional (CNN) me një Rrjet Neuronal Rekurent (LSTM) për të krijuar një gjenerator përshkrimesh për imazhe.

Grupi i të dhënave: Flickr 8K

Gjuha: Python

Korniza: Keras

10. Zbulesa e Mashtrimit të Kartave të Kreditit

BĂ«ni maksimumin duke punuar nĂ« idenĂ« e projektit Data Science — zbulimi i mashtrimeve me karta krediti pĂ«rmes mĂ«simit tĂ« makinerive.

14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

Derisa të arrini këtë pikë, keni filluar të kuptoni metodat dhe konceptet. Le të kalojmë në disa projekte më të avancuara në fushën e shkencave të të dhënave. Në këtë projekt do të përdorim gjuhën R me algoritme të tillë si pemët e vendimmarrjes, regresioni logjistik, rrjetet nervore të artificiale dhe klasifikuesi i përmirësimit të gradientit. Ne do të përdorim një set të dhënash të transaksioneve me karta për të klasifikuar transaksionet e kartave të kreditit si mashtruese ose të vërteta. Ne do të zgjidhim modele të ndryshme dhe do të ndërtojmë kurba performancës.

Gjuha: R

Grupi i të dhënave/Paketa: Seti i të dhënave të Transaksioneve me Karta

11. Sistema i rekomandimeve për filma

Eksploroni realizimin e projektit mĂ« tĂ« mirĂ« tĂ« ShkencĂ«s sĂ« tĂ« DhĂ«nave me Kodin Burimor — Sistema e rekomandimeve pĂ«r filma nĂ« R

14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

NĂ« kĂ«tĂ« projekt tĂ« ShkencĂ«s sĂ« tĂ« DhĂ«nave, ne do tĂ« pĂ«rdorim R pĂ«r tĂ« realizuar rekomandimet pĂ«r filma pĂ«rmes mĂ«simit tĂ« makinerive. Sistemi i rekomandimeve dĂ«rgon sugjerime pĂ«rdoruesve pĂ«rmes njĂ« procesi filtrimi, duke u bazuar nĂ« preferencat e pĂ«rdoruesve tĂ« tjerĂ« dhe historinĂ« e shikimeve. NĂ«se A dhe B e pĂ«lqejnĂ« Home Alone, dhe B e do Mean Girls, mund t'i sugjerohet A — mund t'i pĂ«lqejĂ« edhe atij. Kjo lejon qĂ« klientĂ«t tĂ« ndĂ«rveprojnĂ« me platformĂ«n.

Gjuha: R

Grupi i të dhënave/Paketa: Seti i të dhënave MovieLens

12. Segmente të klientëve

BĂ«ni pĂ«rshtypje tĂ« punĂ«dhĂ«nĂ«sve me ndihmĂ«n e projektit tĂ« ShkencĂ«s sĂ« tĂ« DhĂ«nave (duke pĂ«rfshirĂ« kodin burimor) — Segmentimi i klientĂ«ve pĂ«rmes mĂ«simit tĂ« makinerive.

14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

Segmentimi i blerësve është një aplikacion popullor mësimi i paushtuar (unsupervised learning). Duke përdorur grupimin, kompanitë përcaktojnë segmentet e klientëve për të punuar me një bazë të mundshme përdoruesish. Ato ndajnë klientët në grupe sipas karakteristikave të përbashkëta, siç janë gjinia, mosha, interesat dhe zakonet e shpenzimit, në mënyrë që të mund të shesin produktet e tyre në mënyrë efikase për çdo grup. Ne do të përdorim grupimin K-means, si dhe të visualizojmë shpërndarjen sipas gjinisë dhe moshës. Më pas do të analizojmë të ardhurat e tyre vjetore dhe nivelin e shpenzimeve.

Gjuha: R

Grupi i të dhënave/Paketa: datasetin Mall_Customers

13. Klassifikimi i Kancerit të Gjirit

Shikoni realizimin e plotĂ« tĂ« projektit tĂ« ShkencĂ«s sĂ« tĂ« DhĂ«nave nĂ« Python — Klassifikimi i Kancerit tĂ« Gjirit duke pĂ«rdorur tĂ« MĂ«suarit e thellĂ«.

14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

Duke u kthyer te kontributi mjekësor i shkencës së të dhënave, le të mësojmë të identifikojmë kancerin e gjirit duke përdorur Python. Ne do të përdorim setin e të dhënave IDC_regular për të identifikuar karcinomën invazive të kanaleve, lloji më i zakonshëm i kancerit të gjirit. Ai zhvillohet në kanalet e qumështit, duke depërtuar në indet fibrilare ose yndyrore të gjirit nga jashtë kanalit. Në këtë projekt shkencor të mbledhjes së të dhënave ne do të përdorim Deep Learning dhe bibliotekën Keras për klasifikim.

Gjuha: Python

Grupi i të dhënave/Paketa: IDC_regular

14. Traffic Signs Recognition (NJohja e Shenjave Rrugore)

Arritja e saktësisë në teknologjinë e drejtimit të automjeteve me projektin e shkencës së të dhënave për njohjen e shenjave rrugore duke përdorur CNN me kod të hapur.

14 projekte me burim të hapur për të përmirësuar aftësitë në Data Science (lehtë, normal, e vështirë)

Tabelat e trafikut dhe rregullat e qarkullimit janĂ« shumĂ« tĂ« rĂ«ndĂ«sishme pĂ«r çdo shofer pĂ«r tĂ« shmangur aksidentet. PĂ«r tĂ« respektuar rregullin, sĂ« pari duhet tĂ« kuptohet si duket njĂ« tabelĂ« e trafikut. NjĂ«ri duhet tĂ« mĂ«sojĂ« tĂ« gjitha tabelat e trafikut para se t'i jepet leja pĂ«r tĂ« drejtuar ndonjĂ« mjet. Por tani numri i mjeteve autonome Ă«shtĂ« nĂ« rritje dhe nĂ« tĂ« ardhmen tĂ« ardhmen, njeriu nuk do tĂ« drejtojĂ« mĂ« vetĂ« makinĂ«n. NĂ« projektin “Njohja e Tabelave tĂ« Trafikut” do tĂ« mĂ«soni si programi mund tĂ« njohĂ« llojin e tabelave tĂ« trafikut duke marrĂ« imazhin si hyrje. Grupi i tĂ« dhĂ«nave pĂ«r njohjen e tabelave tĂ« trafikut nĂ« Gjermani (GTSRB) pĂ«rdoret pĂ«r ndĂ«rtimin e njĂ« rrjeti nervor tĂ« thellĂ« pĂ«r tĂ« njohur klasĂ«n nĂ« tĂ« cilĂ«n pĂ«rket tabela e trafikut. Ne gjithashtu po krijojmĂ« njĂ« ndĂ«rfaqe grafike tĂ« thjeshtĂ« pĂ«r ndĂ«rveprimin me aplikacionin.

Gjuha: Python

Grupi i të dhënave: GTSRB (German Traffic Sign Recognition Benchmark)

Lexoni më shumë

Burimi: habr.com

Bli njĂ« hosting tĂ« besueshĂ«m pĂ«r faqet me mbrojtje DDoS, VPS VDS serverĂ« đŸ”„ Bli njĂ« hosting tĂ« besueshĂ«m pĂ«r faqet me mbrojtje DDoS, VPS VDS serverĂ« | ProHoster