Data Science սկսնակների համար
1. Ոգիների վերլուծություն (Տեքստի միջոցով ոգիների վերլուծություն)

Դիտեք Data Science նախագծի ամբողջական իրականացումը՝ օգտագործելով օրիգինալ ծածկագիրը — .
Հոգեկան վերլուծությունը բառերի վերլուծությունն է՝ տրամադրությունները և կարծիքները բացահայտելու համար, որոնք կարող են լինել դրական կամ բացասական։ Սա դասակարգման տեսակ է, որտեղ դասերը կարող են լինել երկուական (դրական և բացասական) կամ բազմապատիկ (ուրախ, քաղցր, տխուր, անհարմար ...)։ Քանի որ մենք կիրառում ենք այս Data Science նախագիծը R լեզվով, մենք կոճղենք տվյալների հավաքածու, որն ունի «janeaustenR» փաթեթ։ Մենք կիրառում ենք ընդհանուր նպատակի բառամփոփիչներ, ինչպիսիք են AFINN, Bing և Loughran, կատարում ներքին միացում, և վերջում մենք ստեղծելու ենք բառամփոփիչ, որպեսզի պատկերացնենք արդյունքը։
Լեզու՝ R
Տվյալների հավաքածու/Փաթեթ՝ janeaustenR
Հոդվածը թարգմանված է EDISON Software ընկերության աջակցությամբ, որը , ինչպես նաև .
2. Ֆեյքային լուրերի հայտնաբերում (Fake News Detection)
Բարձրացրեք ձեր հմտությունները՝ աշխատելով Data Science նախագիծի վրա սկսնակների համար — .

Ֆեյքային լուրերը կեղծ տեղեկություններ են, որոնք տարածվում են սոցիալական ցանցերի և այլ առցանց լրատվամիջոցների միջոցով քաղաքական նպատակների հասնելու համար։ Այս Data Science նախագծի գաղափարում մենք կիրառում ենք Python՝ մոդել ստեղծելու համար, որը օպտիմալ կերպով որոշում է, թե արդյոք նորությունը իրական է, թե ունակ է կեղծ լինել։ Մենք ստեղծելու ենք TfidfVectorizer և կիրառում PassiveAggressiveClassifier լուրերի դասակարգման համար՝ «իրական» և «ֆեյք»։ Մենք կիրառելու ենք 7796 × 4 ձևաչափի տվյալների հավաքածու և ամեն ինչ կիրառում Jupyter Lab-ում։
Լեզու՝ Python
Տվյալների հավաքածու/Փաթեթ՝ news.csv
3. Պարկինսոնի հիվանդության հայտնաբերում (Detecting Parkinson’s Disease)
Նախորդն առաջ բերեք՝ աշխատելով Data Science նախագծի մտքի վրա — .

Մենք սկսել ենք Data Science օգտագործել առողջապահության և ծառայությունների բարելավման համար — եթե մենք կարող ենք հիվանդությունը կանխատեսել վաղ փուլում, ապա մենք ունենալու ենք բազմաթիվ առավելություններ։ Ուրեմն, այս Data Science նախագծի գաղափարում մենք սովորելու ենք հայտնաբերել Պարկինսոնի հիվանդությունը Python-ի միջոցով։ Սա նյարդային, զարգացող հիվանդություն է, որը ազդում է կենտրոնական նյարդային համակարգի շարժերի և առաջացնում է թուլություն և կարծրություն։ Դա ազդում է դոֆամին արտադրող նեյրոնների վրա brains, և յուրաքանչյուր տարի դա ազդում է 1 միլիոնից ավելի մարդուն Հնդկաստանում։
Լեզու՝ Python
Տվյալների հավաքածու/Փաթեթ՝ UCI ML Parkinsons dataset
Միջին բարդության Data Science նախագծեր
4. Խոսքի էմոցիոնալ ճանաչում (Speech Emotion Recognition)
Ազդարարեք Data Science օրինակ նախագիծի ամբողջական իրականացումը — .

Եկեք հիմա սովորենք օգտագործել տարբեր գրադարաններ: Այս Data Science նախագիծը օգտագործում է librosa խոսի ճանաչման համար: SER-ը անհատի զգացմունքներն ու զգացմունքային վիճակները խոսքի միջոցով որոշելու գործընթացն է: Քանի որ մենք օգտագործում ենք տոնն ու տոնի բարձրությունը զգացմունքները արտահայտելու համար, SER-ը շատ նշանակալի է: Բայց մտածելով, որ զգացմունքները սուբյեկտիվ են, ձայնի anotir-ը բավականին բարդ աշխատանք է: Մենք օգտագործելու ենք mfcc, chroma և mel ֆունկցիաները և RAVDESS տվյալների հավաքածուն զգացմունքները ճանաչելու համար: Մենք ստեղծելու ենք MLPC դասակարգիչ այս մոդելի համար.
Լեզու՝ Python
Տվյալների հավաքածու/Փաթեթ՝ RAVDESS տվյալների հավաքածու
5. Սեռի և Տարիքի Որոշում (Gender and Age Detection)
Հիացրեք գործատուներին նորագույն Data Science նախագծով — .

Այս նախագիծը հետաքրքիր է Data Science- ի հետ Python- ով: Միայն մեկ լուսանկար օգտագործելով, դուք սովորելու եք կանխագուշակել մարդու սեռը և տարիքը: Այս ընթացքում մենք կծանոթացնենք Computer Vision և դրա սկզբունքներին: Մենք կկառուցենք և կօգտագործենք Tal Hassner և Gil Levi- ի կողմից ուսուցված մոդելները Adience տվյալների հավաքածուի համար: Ճանապարհին մենք օգտագործելու ենք մի քանի .pb, .pbtxt, .prototxt և .caffemodel ֆայլեր:
Լեզու՝ Python
Տվյալների հավաքածու/Փաթեթ՝ Adience
6. Uber Գրաֆիկային Տվյալների Վերլուծություն (Data Analysis)
Տեսեք Data Science նախագծի ամբողջ իրականացումը կոդի հետ — .

Այս տվյալների վերլուծության նախագիծն օգտագործում է ggplot2: Մենք R-ն ու դրա գրադարանները օգտագործելով կհամակարգենք տարբեր պարամետրեր: Մենք կօգտագործենք Uber Pickups տվյալների հավաքածուն Նյու Յորքում և ստեղծելու ենք տեսագրություններ տարվա տարբեր ժամանակահատվածների համար: Սա մեզ ցույց է տալիս, թե ինչպես ժամանակը ազդում է հաճախորդների ուղևորությունների վրա:
Լեզու՝ R
Տվյալների հավաքածու/Փաթեթ՝ Uber Pickups in New York City տվյալների հավաքածու
7. Վարորդի Ցերեկվա Սխալություն (Driver Drowsiness detection)
Բարձրացրեք ձեր հմտությունները աշխատանք կատարելով Top Data Science նախագծում — .

Սպիտակ վարումը չափազանց վտանգավոր է, և յուրաքանչյուր տարի մոտ հազար պատահարներ տեղի են ունենում վարորդների քնելու պատճառով: Այս Python նախագծում մենք ստեղծելու ենք համակարգ, որը կարող է հայտնաբերել քնած վարորդներին, ինչպես նաև ազդարարել նրանց սիգնալով.
Այս նախագիծը իրականացված է Keras և OpenCV օգտագործելով: Մենք օգտագործելու ենք OpenCV խոշորացում և աչքերի հայտնաբերման համար, իսկ Keras-ի միջոցով կ դասակարգենք աչքի վիճակը (Բացված կամ Վերապրում) խորքային նեյրոնային ցանցերի մեթոդներով:
8. Չատ-բոտ (Chatbot)
Ստեղծել շատ՛-բոտ Python- ով և կատարել քայլ առաջ ձեր կարիերայում — .

Չաթ-բոտերը բիզնեսի անբաժանելի մաս են: Շատ կազմակերպություններ ստիպված են տրամադրել ծառայություններ իրենց հաճախորդներին, և դրանք սպասարկելու համար պահանջվում է շատ աշխատուժ, ժամանակ և ջանք: Չաթ-բոտերը կարող են ավտոմատացնել հաճախորդների հետ փոխնթացման մեծ մասը, պատասխանելով հաճախակի հարցերին, որոնք հաճախորդները հարցնում են: Հիմնականապես գոյություն ունի երկու տեսակի չաթ-բոտեր՝ ոլորտական և բաց ոլորտի: Օրինակ, ոլորտային չաթ-բոտը հաճախ օգտագործվում է կոնկրետ խնդիրը լուծելու համար: Հետևաբար, անհրաժեշտ է այն հարմարեցնել արդյունավետ աշխատելու համար ձեր ոլորտում: Բաց ոլորտի չաթ-բոտերին կարելի է հարցնել ցանկացած հարց, ուստի դրանց ուսուցման համար պահանջվում է հսկայական քանակությամբ տվյալներ.
Տվյալների հավաքածու: Intents json ֆայլ
Լեզու՝ Python
Առաջադեմ տվյալների գիտության նախագծեր
9. Նկարների անվանարարող (Image Caption Generator)
Պարզեք նախագծի ամբողջական իրականացումը ուղիղ կոդով՝ .

Նկարների մեջ ինչ-որ բան նկարագրելը մարդկանց համար հեշտ առաջադրանք է, բայց համակարգիչների համար նկարն ընդամենը թվերի հավաքածու է, որոնք ներկայացնում են յուրաքանչյուր պիքսելի գույնի արժեքը: Սա համակարգիչների համար դժվար առաջադրանք է: Նկարն ընկալելը և այնուհետև բնական լեզվով (օրինակ՝ անգլերեն) նկարագրության ստեղծումը նորից դժվար առաջադրանք է: Այս նախագիծը օգտագործում է խոր ուսուցման մեթոդներ՝ իրականացնելու համար կոնվոլյուցիոն նեյրոնային ցանց (CNN) և կրկնվող նեյրոնային ցանց (LSTM)՝ նկարների անվանարարողի ստեղծման համար.
Տվյալների հավաքածու: Flickr 8K
Լեզու՝ Python
Մոդելն է: Keras
10. Կրեդիտային քարտի չարաշահումների հայտնաբերում (Credit Card Fraud Detection)
Ամեն հնարավորը արեք՝ աշխատելով տվյալների գիտության նախագծի գաղափարի վրա՝ .

Այս պահի համեմատ, դուք արդեն սկսել եք հասկանալ մեթոդները և կոնցեպտները: Let's move to advanced projects in data science. In this project, we will use R language with algorithms such as , տրամաբանական դիագրեր, արհեստական նեյրոնային ցանցեր և աստիճանական բարձրացման դասակարգիչ: Մենք կօգտագործենք քարտերի գործառնությունների տվյալների հավաքածուն `կրեդիտային քարտի գործարքները դասակարգելու հիման վրա՝ որպես չարաշահում կամ իսկական: Մենք կընտրենք տարբեր մոդելներ և կստեղծենք կատարողական մակարդակի գծապատկերներ.
Լեզու՝ R
Տվյալների հավաքածու/Փաթեթ՝ Card Transactions dataset
11. Ֆիլմերի առաջարկների համակարգ (Movie Recommendation System)
Սովորեք լավագույն տվյալների գիտության նախագծի իրականացումը ու ուղիղ կոդով՝

Այս Data Science նախագծում մենք կօգտագործենք R, որպեսզի ֆիլմերի առաջարկներ կատարենք մեքենայական ուսուցման միջոցով: Առաջարկների համակարգը առաջարկներ է ուղարկում օգտվողներին մյուս օգտվողների նախասիրությունների և դիտման պատմության վրա հիմնված ֆիլտրացման գործընթացի միջոցով: Եթե A-ն և B-ն սիրում են Home Alone-ը, իսկ B-ն սիրում է Mean Girls-ը, entonces A-ին կարող է առաջարկվել՝ դա նրան նույնպես կարող է դուր գալ: Սա թույլ է տալիս հաճախորդներին խաղալ ակնկալիքների դաշտում:
Լեզու՝ R
Տվյալների հավաքածու/Փաթեթ՝ MovieLens տվյալների հավաքածու
12. Հաճախորդների Սեգմենտացում
Ալիև հասկացողություն գործատուների վրա Data Science նախագծի միջոցով (ներառյալ սկիզբնային կոդը) — .

Հաճախորդների սեգմենտացումը տարածված կիրառություն է . Կլաստերացման միջոցով ընկերությունները սահմանում են հաճախորդների սեգմենտներ ապագա օգտվողների բազայի համար: Նրանք բաժանում են հաճախորդներին խմբերի, հիմնվելով ընդհանուր հատկանիշների, ինչպիսիք են՝ սեռը, տարիքը, հետաքրքրություններն ու ծախսելու սովորույթները, որպեսզի նրանք կարողանան արդյունավետ վաճառել իրենց ապրանքները յուրաքանչյուր խմբին: Մենք կօգտագործենք , ինչպես նաև տեսանելիություն ապահովենք սեռի և տարիքի բաժանման համար: Այնուհետև մենք կվերլուծենք նրանց տարեկան եկամուտները և ծախսերի մակարդակը:
Լեզու՝ R
Տվյալների հավաքածու/Փաթեթ՝ Mall_Customers տվյալների հավաքածու
13. Կանանց Բնական Կրակի Կլասիֆիկացում
Դիտեք Data Science նախագծի ամբողջական իրականացումը Python-ում — .

Վերադարձնելով բժշկական գիտությանը Data Science-ի, սովորենք հայտնաբերել կանանց բջջային կրակը Python-ի միջոցով: Մենք կօգտագործենք IDC_regular տվյալների հավաքածուն՝ ներխուժող դիալոպատի անտեսողություն հայտնաբերելու համար, որը կանանց բջջային կրակի ամենատարածված տեսակն է: Այն զարգանում է կաթնամթերքի խողովակներում, ներթափանցելով լորձաթաղանթի կամ ճարպի պլազմա: Այս տվյալների հավաքագրման գիտական գաղափարում մենք կօգտագործենք և Keras գրադարան՝ կլասիֆիկացման համար:
Լեզու՝ Python
Տվյալների հավաքածու/Փաթեթ՝ IDC_regular
14. Ճանապարհային Այլանշանների Տեղորոշում
Մեքենաների ինքնակառավարման տեխնոլոգիաների ճշգրտությունը արդյունաբերության Data Science նախագծի միջոցով անվճար ծածկագրով:

ճանապարհային նշանները և ճանապարհային ընթացակարգերը շատ կարևոր են յուրաքանչյուր վարորդի համար՝ անաքրեթությանը խուսափելու համար: Անցակետն հետևելու համար, նախ անհրաժեշտ է հասկանալ, թե ինչ տեսք ունի ճանապարհային նշանը: Իմացեք բոլոր ճանապարհային նշանները, նախքան ձեզ տրվելու իրավունք վարելու որևէ տրանսպորտային միջոց: Սակայն այս պահին ինքնավար տրանսպորտային միջոցների քանակը աճում է, և մոտ ապագայում մարդը այլևս ինքնուրույն չի ղեկավարի մեքենան: «Ճանապարհային նշանների զննություն» նախագծում դուք առումով узнаете, թե ինչպես ծրագիրը կարող է ճանաչել ճանապարհային նշանների սորտը, պատկեր ունենալով որպես մուտքային ազդանշան: Գերմանիայի ճանապարհային նշանների ճանաչման տվյալների հավաքածուն (GTSRB) օգտագործվում է ճանապարհային նշանի դասը ճանաչելու համար խորքային նեյրոնային ցանց կառուցելու նպատակով: Մենք նաև ստեղծում ենք պարզ գրաֆիկական միջերես՝ ծրագրի հետ փոխազդելու համար.
Լեզու՝ Python
Տվյալների հավաքածու: GTSRB (Գերմանական ճանապարհային նշանների ճանաչման ստանդարտ)
կարդալ ավելին
Ընտանիք: habr.com
