14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

Data Science սկսնակների համար

1. Ոգիների վերլուծություն (Տեքստի միջոցով ոգիների վերլուծություն)

14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

Դիտեք Data Science նախագծի ամբողջական իրականացումը՝ օգտագործելով օրիգինալ ծածկագիրը — Հոգեկան վերլուծության նախագիծ R-ում.

Հոգեկան վերլուծությունը բառերի վերլուծությունն է՝ տրամադրությունները և կարծիքները բացահայտելու համար, որոնք կարող են լինել դրական կամ բացասական։ Սա դասակարգման տեսակ է, որտեղ դասերը կարող են լինել երկուական (դրական և բացասական) կամ բազմապատիկ (ուրախ, քաղցր, տխուր, անհարմար ...)։ Քանի որ մենք կիրառում ենք այս Data Science նախագիծը R լեզվով, մենք կոճղենք տվյալների հավաքածու, որն ունի «janeaustenR» փաթեթ։ Մենք կիրառում ենք ընդհանուր նպատակի բառամփոփիչներ, ինչպիսիք են AFINN, Bing և Loughran, կատարում ներքին միացում, և վերջում մենք ստեղծելու ենք բառամփոփիչ, որպեսզի պատկերացնենք արդյունքը։

Լեզու՝ R
Տվյալների հավաքածու/Փաթեթ՝ janeaustenR

14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

Հոդվածը թարգմանված է EDISON Software ընկերության աջակցությամբ, որը կարողացնում է բազմազան ապրանքանիշերի խանութների համար վիրտուալ փորձարկումներ, ինչպես նաև թեստավորում է ծրագրային ապահովումը.

2. Ֆեյքային լուրերի հայտնաբերում (Fake News Detection)

Բարձրացրեք ձեր հմտությունները՝ աշխատելով Data Science նախագիծի վրա սկսնակների համար — պատահական լուրերի հայտնաբերում Python-ի միջոցով.

14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

Ֆեյքային լուրերը կեղծ տեղեկություններ են, որոնք տարածվում են սոցիալական ցանցերի և այլ առցանց լրատվամիջոցների միջոցով քաղաքական նպատակների հասնելու համար։ Այս Data Science նախագծի գաղափարում մենք կիրառում ենք Python՝ մոդել ստեղծելու համար, որը օպտիմալ կերպով որոշում է, թե արդյոք նորությունը իրական է, թե ունակ է կեղծ լինել։ Մենք ստեղծելու ենք TfidfVectorizer և կիրառում PassiveAggressiveClassifier լուրերի դասակարգման համար՝ «իրական» և «ֆեյք»։ Մենք կիրառելու ենք 7796 × 4 ձևաչափի տվյալների հավաքածու և ամեն ինչ կիրառում Jupyter Lab-ում։

Լեզու՝ Python

Տվյալների հավաքածու/Փաթեթ՝ news.csv

3. Պարկինսոնի հիվանդության հայտնաբերում (Detecting Parkinson’s Disease)

Նախորդն առաջ բերեք՝ աշխատելով Data Science նախագծի մտքի վրա — Պարկինսոնի հիվանդության ճշգրտում XGBoost-ի օգնությամբ.

14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

Մենք սկսել ենք Data Science օգտագործել առողջապահության և ծառայությունների բարելավման համար — եթե մենք կարող ենք հիվանդությունը կանխատեսել վաղ փուլում, ապա մենք ունենալու ենք բազմաթիվ առավելություններ։ Ուրեմն, այս Data Science նախագծի գաղափարում մենք սովորելու ենք հայտնաբերել Պարկինսոնի հիվանդությունը Python-ի միջոցով։ Սա նյարդային, զարգացող հիվանդություն է, որը ազդում է կենտրոնական նյարդային համակարգի շարժերի և առաջացնում է թուլություն և կարծրություն։ Դա ազդում է դոֆամին արտադրող նեյրոնների վրա brains, և յուրաքանչյուր տարի դա ազդում է 1 միլիոնից ավելի մարդուն Հնդկաստանում։

Լեզու՝ Python

Տվյալների հավաքածու/Փաթեթ՝ UCI ML Parkinsons dataset

Միջին բարդության Data Science նախագծեր

4. Խոսքի էմոցիոնալ ճանաչում (Speech Emotion Recognition)

Ազդարարեք Data Science օրինակ նախագիծի ամբողջական իրականացումը — Խոսքի ճանաչում Librosa-ի միջոցով.

14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

Եկեք հիմա սովորենք օգտագործել տարբեր գրադարաններ: Այս Data Science նախագիծը օգտագործում է librosa խոսի ճանաչման համար: SER-ը անհատի զգացմունքներն ու զգացմունքային վիճակները խոսքի միջոցով որոշելու գործընթացն է: Քանի որ մենք օգտագործում ենք տոնն ու տոնի բարձրությունը զգացմունքները արտահայտելու համար, SER-ը շատ նշանակալի է: Բայց մտածելով, որ զգացմունքները սուբյեկտիվ են, ձայնի anotir-ը բավականին բարդ աշխատանք է: Մենք օգտագործելու ենք mfcc, chroma և mel ֆունկցիաները և RAVDESS տվյալների հավաքածուն զգացմունքները ճանաչելու համար: Մենք ստեղծելու ենք MLPC դասակարգիչ այս մոդելի համար.

Լեզու՝ Python

Տվյալների հավաքածու/Փաթեթ՝ RAVDESS տվյալների հավաքածու

5. Սեռի և Տարիքի Որոշում (Gender and Age Detection)

Հիացրեք գործատուներին նորագույն Data Science նախագծով — սեռի և տարիքի որոշում OpenCV- ում.

14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

Այս նախագիծը հետաքրքիր է Data Science- ի հետ Python- ով: Միայն մեկ լուսանկար օգտագործելով, դուք սովորելու եք կանխագուշակել մարդու սեռը և տարիքը: Այս ընթացքում մենք կծանոթացնենք Computer Vision և դրա սկզբունքներին: Մենք կկառուցենք конволյուդային նեյրոնային ցանց և կօգտագործենք Tal Hassner և Gil Levi- ի կողմից ուսուցված մոդելները Adience տվյալների հավաքածուի համար: Ճանապարհին մենք օգտագործելու ենք մի քանի .pb, .pbtxt, .prototxt և .caffemodel ֆայլեր:

Լեզու՝ Python

Տվյալների հավաքածու/Փաթեթ՝ Adience

6. Uber Գրաֆիկային Տվյալների Վերլուծություն (Data Analysis)

Տեսեք Data Science նախագծի ամբողջ իրականացումը կոդի հետ — Uber Data Analysis Project R- ում.

14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

Այս տվյալների վերլուծության նախագիծն օգտագործում է ggplot2: Մենք R-ն ու դրա գրադարանները օգտագործելով կհամակարգենք տարբեր պարամետրեր: Մենք կօգտագործենք Uber Pickups տվյալների հավաքածուն Նյու Յորքում և ստեղծելու ենք տեսագրություններ տարվա տարբեր ժամանակահատվածների համար: Սա մեզ ցույց է տալիս, թե ինչպես ժամանակը ազդում է հաճախորդների ուղևորությունների վրա:

Լեզու՝ R

Տվյալների հավաքածու/Փաթեթ՝ Uber Pickups in New York City տվյալների հավաքածու

7. Վարորդի Ցերեկվա Սխալություն (Driver Drowsiness detection)

Բարձրացրեք ձեր հմտությունները աշխատանք կատարելով Top Data Science նախագծում — OpenCV & Keras-ի օգտագործմամբ ձկնորսության համակարգ.

14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

Սպիտակ վարումը չափազանց վտանգավոր է, և յուրաքանչյուր տարի մոտ հազար պատահարներ տեղի են ունենում վարորդների քնելու պատճառով: Այս Python նախագծում մենք ստեղծելու ենք համակարգ, որը կարող է հայտնաբերել քնած վարորդներին, ինչպես նաև ազդարարել նրանց սիգնալով.

Այս նախագիծը իրականացված է Keras և OpenCV օգտագործելով: Մենք օգտագործելու ենք OpenCV խոշորացում և աչքերի հայտնաբերման համար, իսկ Keras-ի միջոցով կ դասակարգենք աչքի վիճակը (Բացված կամ Վերապրում) խորքային նեյրոնային ցանցերի մեթոդներով:

8. Չատ-բոտ (Chatbot)

Ստեղծել շատ՛-բոտ Python- ով և կատարել քայլ առաջ ձեր կարիերայում — Chatbot NLTK & Keras- ով.

14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

Չաթ-բոտերը բիզնեսի անբաժանելի մաս են: Շատ կազմակերպություններ ստիպված են տրամադրել ծառայություններ իրենց հաճախորդներին, և դրանք սպասարկելու համար պահանջվում է շատ աշխատուժ, ժամանակ և ջանք: Չաթ-բոտերը կարող են ավտոմատացնել հաճախորդների հետ փոխնթացման մեծ մասը, պատասխանելով հաճախակի հարցերին, որոնք հաճախորդները հարցնում են: Հիմնականապես գոյություն ունի երկու տեսակի չաթ-բոտեր՝ ոլորտական և բաց ոլորտի: Օրինակ, ոլորտային չաթ-բոտը հաճախ օգտագործվում է կոնկրետ խնդիրը լուծելու համար: Հետևաբար, անհրաժեշտ է այն հարմարեցնել արդյունավետ աշխատելու համար ձեր ոլորտում: Բաց ոլորտի չաթ-բոտերին կարելի է հարցնել ցանկացած հարց, ուստի դրանց ուսուցման համար պահանջվում է հսկայական քանակությամբ տվյալներ.

Տվյալների հավաքածու: Intents json ֆայլ

Լեզու՝ Python

Առաջադեմ տվյալների գիտության նախագծեր

9. Նկարների անվանարարող (Image Caption Generator)

Պարզեք նախագծի ամբողջական իրականացումը ուղիղ կոդով՝ Նկարների անվանարարող CNN & LSTM-ով.

14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

Նկարների մեջ ինչ-որ բան նկարագրելը մարդկանց համար հեշտ առաջադրանք է, բայց համակարգիչների համար նկարն ընդամենը թվերի հավաքածու է, որոնք ներկայացնում են յուրաքանչյուր պիքսելի գույնի արժեքը: Սա համակարգիչների համար դժվար առաջադրանք է: Նկարն ընկալելը և այնուհետև բնական լեզվով (օրինակ՝ անգլերեն) նկարագրության ստեղծումը նորից դժվար առաջադրանք է: Այս նախագիծը օգտագործում է խոր ուսուցման մեթոդներ՝ իրականացնելու համար կոնվոլյուցիոն նեյրոնային ցանց (CNN) և կրկնվող նեյրոնային ցանց (LSTM)՝ նկարների անվանարարողի ստեղծման համար.

Տվյալների հավաքածու: Flickr 8K

Լեզու՝ Python

Մոդելն է: Keras

10. Կրեդիտային քարտի չարաշահումների հայտնաբերում (Credit Card Fraud Detection)

Ամեն հնարավորը արեք՝ աշխատելով տվյալների գիտության նախագծի գաղափարի վրա՝ կրեդիտային քարտի չարաշահումների հայտնաբերում մեքենայական ուսուցման միջոցով.

14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

Այս պահի համեմատ, դուք արդեն սկսել եք հասկանալ մեթոդները և կոնցեպտները: Let's move to advanced projects in data science. In this project, we will use R language with algorithms such as որոշման ծառեր,, տրամաբանական դիագրեր, արհեստական նեյրոնային ցանցեր և աստիճանական բարձրացման դասակարգիչ: Մենք կօգտագործենք քարտերի գործառնությունների տվյալների հավաքածուն `կրեդիտային քարտի գործարքները դասակարգելու հիման վրա՝ որպես չարաշահում կամ իսկական: Մենք կընտրենք տարբեր մոդելներ և կստեղծենք կատարողական մակարդակի գծապատկերներ.

Լեզու՝ R

Տվյալների հավաքածու/Փաթեթ՝ Card Transactions dataset

11. Ֆիլմերի առաջարկների համակարգ (Movie Recommendation System)

Սովորեք լավագույն տվյալների գիտության նախագծի իրականացումը ու ուղիղ կոդով՝ Ֆիլմերի առաջարկների համակարգ R լեզվով

14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

Այս Data Science նախագծում մենք կօգտագործենք R, որպեսզի ֆիլմերի առաջարկներ կատարենք մեքենայական ուսուցման միջոցով: Առաջարկների համակարգը առաջարկներ է ուղարկում օգտվողներին մյուս օգտվողների նախասիրությունների և դիտման պատմության վրա հիմնված ֆիլտրացման գործընթացի միջոցով: Եթե A-ն և B-ն սիրում են Home Alone-ը, իսկ B-ն սիրում է Mean Girls-ը, entonces A-ին կարող է առաջարկվել՝ դա նրան նույնպես կարող է դուր գալ: Սա թույլ է տալիս հաճախորդներին խաղալ ակնկալիքների դաշտում:

Լեզու՝ R

Տվյալների հավաքածու/Փաթեթ՝ MovieLens տվյալների հավաքածու

12. Հաճախորդների Սեգմենտացում

Ալիև հասկացողություն գործատուների վրա Data Science նախագծի միջոցով (ներառյալ սկիզբնային կոդը) — Հաճախորդների սեգմենտացում մեքենայական ուսուցման միջոցով.

14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

Հաճախորդների սեգմենտացումը տարածված կիրառություն է контролируемого обучения (unsupervised learning). Կլաստերացման միջոցով ընկերությունները սահմանում են հաճախորդների սեգմենտներ ապագա օգտվողների բազայի համար: Նրանք բաժանում են հաճախորդներին խմբերի, հիմնվելով ընդհանուր հատկանիշների, ինչպիսիք են՝ սեռը, տարիքը, հետաքրքրություններն ու ծախսելու սովորույթները, որպեսզի նրանք կարողանան արդյունավետ վաճառել իրենց ապրանքները յուրաքանչյուր խմբին: Մենք կօգտագործենք K-means կլաստերացում, ինչպես նաև տեսանելիություն ապահովենք սեռի և տարիքի բաժանման համար: Այնուհետև մենք կվերլուծենք նրանց տարեկան եկամուտները և ծախսերի մակարդակը:

Լեզու՝ R

Տվյալների հավաքածու/Փաթեթ՝ Mall_Customers տվյալների հավաքածու

13. Կանանց Բնական Կրակի Կլասիֆիկացում

Դիտեք Data Science նախագծի ամբողջական իրականացումը Python-ում — Կանանց բջջային կրակի clasificación միջոցով խորքային ուսուցման.

14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

Վերադարձնելով բժշկական գիտությանը Data Science-ի, սովորենք հայտնաբերել կանանց բջջային կրակը Python-ի միջոցով: Մենք կօգտագործենք IDC_regular տվյալների հավաքածուն՝ ներխուժող դիալոպատի անտեսողություն հայտնաբերելու համար, որը կանանց բջջային կրակի ամենատարածված տեսակն է: Այն զարգանում է կաթնամթերքի խողովակներում, ներթափանցելով լորձաթաղանթի կամ ճարպի պլազմա: Այս տվյալների հավաքագրման գիտական գաղափարում մենք կօգտագործենք Deep Learning և Keras գրադարան՝ կլասիֆիկացման համար:

Լեզու՝ Python

Տվյալների հավաքածու/Փաթեթ՝ IDC_regular

14. Ճանապարհային Այլանշանների Տեղորոշում

Մեքենաների ինքնակառավարման տեխնոլոգիաների ճշգրտությունը արդյունաբերության Data Science նախագծի միջոցով ճանապարհային այլանշանների ճանաչման միջոցով CNN անվճար ծածկագրով:

14 բաց աղբյուրի նախագծեր Data Science հմտությունները զարգացնելու համար (հեշտ, միջին, դժվար)

ճանապարհային նշանները և ճանապարհային ընթացակարգերը շատ կարևոր են յուրաքանչյուր վարորդի համար՝ անաքրեթությանը խուսափելու համար: Անցակետն հետևելու համար, նախ անհրաժեշտ է հասկանալ, թե ինչ տեսք ունի ճանապարհային նշանը: Իմացեք բոլոր ճանապարհային նշանները, նախքան ձեզ տրվելու իրավունք վարելու որևէ տրանսպորտային միջոց: Սակայն այս պահին ինքնավար տրանսպորտային միջոցների քանակը աճում է, և մոտ ապագայում մարդը այլևս ինքնուրույն չի ղեկավարի մեքենան: «Ճանապարհային նշանների զննություն» նախագծում դուք առումով узнаете, թե ինչպես ծրագիրը կարող է ճանաչել ճանապարհային նշանների սորտը, պատկեր ունենալով որպես մուտքային ազդանշան: Գերմանիայի ճանապարհային նշանների ճանաչման տվյալների հավաքածուն (GTSRB) օգտագործվում է ճանապարհային նշանի դասը ճանաչելու համար խորքային նեյրոնային ցանց կառուցելու նպատակով: Մենք նաև ստեղծում ենք պարզ գրաֆիկական միջերես՝ ծրագրի հետ փոխազդելու համար.

Լեզու՝ Python

Տվյալների հավաքածու: GTSRB (Գերմանական ճանապարհային նշանների ճանաչման ստանդարտ)

կարդալ ավելին

Ընտանիք: habr.com

Գնել հուսալի հյուրընկալում DDoS պաշտպանությամբ, VPS VDS սերվերներով 🔥 Գնել հուսալի հյուրընկալում DDoS պաշտպանությամբ, VPS VDS սերվերներով | ProHoster