Zgjedhja e karakteristikave në mësimin e makinerive

Përshëndetje, Habr!

Ne në «Rexoft» kemi përkthyer në gjuhën ruse një artikull Zgjedhja e Veçorive në Mësimin e Makinerive. Shpresojmë se do të jetë e dobishme për të gjithë ata që janë të interesuar në këtë temë.

Në botën reale, të dhënat nuk janë gjithmonë aq të pastra sa ndonjëherë mendojnë porositësit e bizneseve. Pikërisht për këtë arsye analiza inteligjente e të dhënave (data mining dhe data wrangling) është në kërkesë. Ajo ndihmon në zbulojnë vlerat e munguar dhe modelet në të dhëna të strukturuara duke përdorur kërkesa që nuk mund të përcaktohet nga njeriu. Për të gjetur dhe përdorur këto modele për të parashikuar rezultatet përmes lidhjeve të zbuluara në të dhëna do të ndihmojë mësimi i makinës (Machine Learning).

PĂ«r tĂ« kuptuar çdo algoritĂ«m, Ă«shtĂ« e nevojshme tĂ« shqyrtohen tĂ« gjitha variablat nĂ« tĂ« dhĂ«na dhe tĂ« zbulohet se çfarĂ« pĂ«rfaqĂ«sojnĂ« kĂ«to variabla. Kjo Ă«shtĂ« jashtĂ«zakonisht e rĂ«ndĂ«sishme, pasi arsyetimi i rezultateve bazohet nĂ« kuptimin e tĂ« dhĂ«nave. NĂ«se tĂ« dhĂ«nat pĂ«rmbajnĂ« 5 apo edhe 50 variabla, mund tĂ« studiohen tĂ« gjithĂ« ato. Por çfarĂ« nĂ«se ka 200? AtĂ«herĂ« thjesht nuk do tĂ« mjaftojnĂ« burimet pĂ«r tĂ« studiuar çdo variabĂ«l tĂ« veçantĂ«. PĂ«r mĂ« tepĂ«r, disa algoritme nuk funksionojnĂ« pĂ«r tĂ« dhĂ«nat kategorike, dhe atĂ«herĂ« do tĂ« duhet tĂ« kthehen tĂ« gjitha kolonat kategorike nĂ« variabla sasiorĂ« (ata mund tĂ« duken sasiorĂ«, por metrikat do tĂ« tregojnĂ« se janĂ« kategorike), pĂ«r t'i shtuar nĂ« model. NĂ« kĂ«tĂ« mĂ«nyrĂ«, numri i variablave rritet dhe arrin nĂ« rreth 500. ÇfarĂ« duhet tĂ« bĂ«jmĂ« tani? Mund tĂ« mendohet se pĂ«rgjigja do tĂ« ishte reduktimi i dimensioneve. Algoritmet e reduktimit tĂ« dimensioneve zvogĂ«lojnĂ« numrin e parametrave, por ndikojnĂ« negativisht nĂ« interpretuarshmĂ«rinĂ«. ÇfarĂ« nĂ«se ekzistojnĂ« teknika tĂ« tjera qĂ« pĂ«rjashtojnĂ« veçoritĂ« dhe pĂ«r mĂ« tepĂ«r lejojnĂ« tĂ« kuptohen dhe interpretohen lehtĂ«sisht ato qĂ« mbeten?

Në varësi të asaj se a bazohet analiza në regresion apo klasifikim, algoritmet e selektimit të veçorive mund të jenë të ndryshme, por ideja kryesore e realizimit të tyre mbetet e njëjtë.

Variablat me korrelacion të lartë

Variablat e forta të korrelacionit mes njëra-tjetrës ofrojnë të njëjtin informacion për modelin, prandaj nuk është e nevojshme të përdoren të gjitha ato për analizë. Për shembull, nëse grupi i të dhënave (dataset) përmban karakteristikat "Koha në rrjet" dhe "Trafiku i përdorur", mund të supozojmë se ato do të jenë në një farë mënyre të korrelacionuara, dhe do të shohim një korrelacion të fortë, pavarësisht se zgjidhim një mostër të pandikshme të të dhënave. Në këtë rast, në model është e nevojshme vetëm një nga këto variabla. Nëse përdoren të dyja, modelin do ta dëmtojë (overfit) dhe do të jetë i kaubur në lidhje me një karakteristikë të veçantë.

Vlerat P

Në algoritme të tilla si regresioni linear, ndërtimi i një modeli fillestar statistik është gjithmonë një ide e mirë. Ai ndihmon për të ilustruar rëndësinë e karakteristikave me anë të vlerave të tyre p, të cilat janë marrë nga ky model. Duke vendosur nivelin e rëndësisë, ne kontrollojmë vlerat e marra p, dhe nëse ndonjë vlerë është më e ulët se niveli i caktuar i rëndësisë, atëherë kjo karakteristikë shpallet e rëndësishme, domethënë ndryshimi i vlerës së saj, me sa duke mund të çojë në ndryshimin e vlerës së objektivit (target).

Zgjedhja direkte

Zgjedhja direkte është një teknikë që përfshin përdorimin e regresionit hap pas hapi. Ndërtimi i modelit fillon nga zero, dmth nga një model bosh, dhe pastaj çdo iteracion shton një variabël që sjell përmirësim në modelin në ndërtim. Cila variabël do të shtohet në model, përcaktohet nga rëndësia e saj. Kjo mund të llogaritet duke përdorur metrika të ndryshme. Më e zakonshmja është përdorimi i vlerave p, të marra në modelin fillestar statistik me përfshirjen e të gjitha variablave. Ndonjëherë, zgjedhja direkte mund të çojë në dëmshpërblim të modelit, sepse në model mund të përfshihen variablat e forta të korrelacionit, ndonëse ato ofrojnë të njëjtin informacion për modelin (por modeli mund të tregojë përmirësim).

Zgjedhja e kundërt

Selekcioni i përsëritur përfshin përjashtimin hap pas hapi të karakteristikave, megjithatë në drejtimin e kundërt krahasuar me atë të drejtpërdrejtë. Në këtë rast, modeli fillestar përfshin të gjitha variablat e pavarur. Më pas, variablat përjashtohen (një për një në çdo iteracion), nëse ata nuk kontribuojnë asnjë vlerë për modelin e ri regresion në çdo iteracion. Baza e përjashtimit të karakteristikave janë treguesit e vlerave-p të modelit fillestar. Në këtë metodë gjithashtu ekziston paqartësia gjatë heqjes së variablave me korrelacion të lartë.

Përjashtimi i përsëritur i karakteristikave

RFE është një teknikë/algoritëm i përdorur gjerësisht për të zgjedhur numrin e saktë të karakteristikave mjaft të rëndësishme. Ndonjëherë metoda përdoret për të shpjeguar disa nga "karakteristikat më të rëndësishme" që ndikojnë në rezultatet; dhe ndonjëherë për të zvogëluar një numër shumë të madh variablash (rreth 200-400), dhe të lihen vetëm ata që japin ndonjë kontribut në model, ndërsa të tjerët përjashtohen. RFE përdor një sistem rangimi. Karakteristikave në grupin e të dhënave u jepen rangu. Më pas këto rangje përdoren për përjashtimin e përsëritur të karakteristikave në varësi të kolinearitetit midis tyre dhe rëndësisë së këtyre karakteristikave në model. Përveç rangimit të karakteristikave, RFE mund të tregojë nëse këto karakteristika janë të rëndësishme apo jo, edhe për një numër të caktuar karakteristikash (sepse është shumë e mundshme që numri i zgjedhur i karakteristikave mund të mos jetë optimal, dhe numri optimal i karakteristikave mund të jetë më i madh ose më i vogël se ai i zgjedhuri).

Diagrami i rëndësisë së karakteristikave

Kur flitet për interpretimin e algoritmeve të mësimit të makinerive, zakonisht diskutohet rreth regresioneve lineare (të cilat lejojnë analizimin e rëndësisë së karakteristikave përmes vlerave-p) dhe pemëve të vendimeve (të cilat tregojnë pikërisht rëndësinë e karakteristikave në formën e një peme, si dhe hierarkinë e tyre). Nga ana tjetër, në algoritme të tilla si Random Forest, LightGBM dhe XG Boost, shpesh përdoret diagrami i rëndësisë së karakteristikave, dmth. krijohet një diagram i variablave dhe "sasisë së rëndësisë së tyre". Kjo është veçanërisht e dobishme kur nevojitet të ofrohet një arsyetim i strukturuar për rëndësinë e karakteristikave nga pikëpamja e ndikimit të tyre në biznes.

Rregullimi

Rregullimi bëhet për të kontrolluar balancën midis paragjykimit (bias) dhe devijimit (variance). Paragjykimi tregon se sa mirë është përshtatur modeli në setin e të dhënave të stërvitjes. Devijimi tregon se sa të ndryshme ishin parashikimet midis seteve të trajnimit dhe testimit. Në mënyrë ideale, si paragjykimi ashtu edhe devijimi duhet të jenë të vogla. Këtu ndihmon rregullimi! Ekzistojnë dy teknikë kryesore:

Rregullimi L1 – Lasso: Lasso ndĂ«shkon pesha e coeficientĂ«ve tĂ« modelit pĂ«r tĂ« ndryshuar rĂ«ndĂ«sinĂ« e tyre pĂ«r modelin dhe madje mund t'i zerojĂ« ato (dmth. tĂ« heqĂ« kĂ«ta variabla nga modeli pĂ«rfundimtar). Zakonisht, Lasso pĂ«rdoret nĂ«se seti i tĂ« dhĂ«nave ka njĂ« numĂ«r tĂ« madh variablash dhe nevojitet pĂ«rjashtimi i disa prej tyre pĂ«r tĂ« kuptuar mĂ« mirĂ« se si faktorĂ«t e rĂ«ndĂ«sishĂ«m ndikojnĂ« nĂ« model (dmth. ato karakteristika qĂ« janĂ« zgjedhur nga Lasso dhe tĂ« cilat kanĂ« rĂ«ndĂ«si tĂ« caktuar).

Rregullimi L2 – metoda Ridge: QĂ«llimi i Ridge Ă«shtĂ« tĂ« ruajĂ« tĂ« gjithĂ« variablat dhe nĂ« tĂ« njĂ«jtĂ«n kohĂ« t'u japĂ« atyre rĂ«ndĂ«si bazuar nĂ« kontributin nĂ« efikasitetin e modelit. Ridge do tĂ« jetĂ« njĂ« zgjedhje e mirĂ« nĂ«se seti i tĂ« dhĂ«nave ka njĂ« numĂ«r tĂ« vogĂ«l variablash dhe tĂ« gjithĂ« ata janĂ« tĂ« nevojshĂ«m pĂ«r interpretime dhe rezultatet e arritura.

Duke qenë se Ridge lë të gjithë variablat, ndërsa Lasso përcakton më mirë rëndësinë e tyre, është zhvilluar një algoritëm që kombinon karakteristikat më të mira të të dyja rregullimeve dhe është i njohur si Elastic-Net.

Ka shumë mënyra të tjera për përzgjedhjen e karakteristikave për mësimin e automatik, por ideja kryesore mbetet gjithmonë e njëjta: të demonstrohet rëndësia e variablave dhe më pas të përjashtohen disa nga ata bazuar në rëndësinë e marrë. Rëndësia është një term shumë subjektiv, pasi nuk është një nivel, por një grup i të dhënave dhe diagrameve që mund të përdoren për të gjetur karakteristikat kyçe.

Faleminderit për leximin! Gëzime në mësim!

Burimi: habr.com

Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster