Përshëndetje, Habr!
Ne në «Rexoft» kemi përkthyer në gjuhën ruse një artikull . Shpresojmë se do të jetë e dobishme për të gjithë ata që janë të interesuar në këtë temë.
Në botën reale, të dhënat nuk janë gjithmonë aq të pastra sa ndonjëherë mendojnë porositësit e bizneseve. Pikërisht për këtë arsye analiza inteligjente e të dhënave (data mining dhe data wrangling) është në kërkesë. Ajo ndihmon në zbulojnë vlerat e munguar dhe modelet në të dhëna të strukturuara duke përdorur kërkesa që nuk mund të përcaktohet nga njeriu. Për të gjetur dhe përdorur këto modele për të parashikuar rezultatet përmes lidhjeve të zbuluara në të dhëna do të ndihmojë mësimi i makinës (Machine Learning).
Për të kuptuar çdo algoritëm, është e nevojshme të shqyrtohen të gjitha variablat në të dhëna dhe të zbulohet se çfarë përfaqësojnë këto variabla. Kjo është jashtëzakonisht e rëndësishme, pasi arsyetimi i rezultateve bazohet në kuptimin e të dhënave. Nëse të dhënat përmbajnë 5 apo edhe 50 variabla, mund të studiohen të gjithë ato. Por çfarë nëse ka 200? Atëherë thjesht nuk do të mjaftojnë burimet për të studiuar çdo variabël të veçantë. Për më tepër, disa algoritme nuk funksionojnë për të dhënat kategorike, dhe atëherë do të duhet të kthehen të gjitha kolonat kategorike në variabla sasiorë (ata mund të duken sasiorë, por metrikat do të tregojnë se janë kategorike), për t'i shtuar në model. Në këtë mënyrë, numri i variablave rritet dhe arrin në rreth 500. Çfarë duhet të bëjmë tani? Mund të mendohet se përgjigja do të ishte reduktimi i dimensioneve. Algoritmet e reduktimit të dimensioneve zvogëlojnë numrin e parametrave, por ndikojnë negativisht në interpretuarshmërinë. Çfarë nëse ekzistojnë teknika të tjera që përjashtojnë veçoritë dhe për më tepër lejojnë të kuptohen dhe interpretohen lehtësisht ato që mbeten?
Në varësi të asaj se a bazohet analiza në regresion apo klasifikim, algoritmet e selektimit të veçorive mund të jenë të ndryshme, por ideja kryesore e realizimit të tyre mbetet e njëjtë.
Variablat me korrelacion të lartë
Variablat e forta të korrelacionit mes njëra-tjetrës ofrojnë të njëjtin informacion për modelin, prandaj nuk është e nevojshme të përdoren të gjitha ato për analizë. Për shembull, nëse grupi i të dhënave (dataset) përmban karakteristikat "Koha në rrjet" dhe "Trafiku i përdorur", mund të supozojmë se ato do të jenë në një farë mënyre të korrelacionuara, dhe do të shohim një korrelacion të fortë, pavarësisht se zgjidhim një mostër të pandikshme të të dhënave. Në këtë rast, në model është e nevojshme vetëm një nga këto variabla. Nëse përdoren të dyja, modelin do ta dëmtojë (overfit) dhe do të jetë i kaubur në lidhje me një karakteristikë të veçantë.
Vlerat P
Në algoritme të tilla si regresioni linear, ndërtimi i një modeli fillestar statistik është gjithmonë një ide e mirë. Ai ndihmon për të ilustruar rëndësinë e karakteristikave me anë të vlerave të tyre p, të cilat janë marrë nga ky model. Duke vendosur nivelin e rëndësisë, ne kontrollojmë vlerat e marra p, dhe nëse ndonjë vlerë është më e ulët se niveli i caktuar i rëndësisë, atëherë kjo karakteristikë shpallet e rëndësishme, domethënë ndryshimi i vlerës së saj, me sa duke mund të çojë në ndryshimin e vlerës së objektivit (target).
Zgjedhja direkte
Zgjedhja direkte është një teknikë që përfshin përdorimin e regresionit hap pas hapi. Ndërtimi i modelit fillon nga zero, dmth nga një model bosh, dhe pastaj çdo iteracion shton një variabël që sjell përmirësim në modelin në ndërtim. Cila variabël do të shtohet në model, përcaktohet nga rëndësia e saj. Kjo mund të llogaritet duke përdorur metrika të ndryshme. Më e zakonshmja është përdorimi i vlerave p, të marra në modelin fillestar statistik me përfshirjen e të gjitha variablave. Ndonjëherë, zgjedhja direkte mund të çojë në dëmshpërblim të modelit, sepse në model mund të përfshihen variablat e forta të korrelacionit, ndonëse ato ofrojnë të njëjtin informacion për modelin (por modeli mund të tregojë përmirësim).
Zgjedhja e kundërt
Selekcioni i përsëritur përfshin përjashtimin hap pas hapi të karakteristikave, megjithatë në drejtimin e kundërt krahasuar me atë të drejtpërdrejtë. Në këtë rast, modeli fillestar përfshin të gjitha variablat e pavarur. Më pas, variablat përjashtohen (një për një në çdo iteracion), nëse ata nuk kontribuojnë asnjë vlerë për modelin e ri regresion në çdo iteracion. Baza e përjashtimit të karakteristikave janë treguesit e vlerave-p të modelit fillestar. Në këtë metodë gjithashtu ekziston paqartësia gjatë heqjes së variablave me korrelacion të lartë.
Përjashtimi i përsëritur i karakteristikave
RFE është një teknikë/algoritëm i përdorur gjerësisht për të zgjedhur numrin e saktë të karakteristikave mjaft të rëndësishme. Ndonjëherë metoda përdoret për të shpjeguar disa nga "karakteristikat më të rëndësishme" që ndikojnë në rezultatet; dhe ndonjëherë për të zvogëluar një numër shumë të madh variablash (rreth 200-400), dhe të lihen vetëm ata që japin ndonjë kontribut në model, ndërsa të tjerët përjashtohen. RFE përdor një sistem rangimi. Karakteristikave në grupin e të dhënave u jepen rangu. Më pas këto rangje përdoren për përjashtimin e përsëritur të karakteristikave në varësi të kolinearitetit midis tyre dhe rëndësisë së këtyre karakteristikave në model. Përveç rangimit të karakteristikave, RFE mund të tregojë nëse këto karakteristika janë të rëndësishme apo jo, edhe për një numër të caktuar karakteristikash (sepse është shumë e mundshme që numri i zgjedhur i karakteristikave mund të mos jetë optimal, dhe numri optimal i karakteristikave mund të jetë më i madh ose më i vogël se ai i zgjedhuri).
Diagrami i rëndësisë së karakteristikave
Kur flitet për interpretimin e algoritmeve të mësimit të makinerive, zakonisht diskutohet rreth regresioneve lineare (të cilat lejojnë analizimin e rëndësisë së karakteristikave përmes vlerave-p) dhe pemëve të vendimeve (të cilat tregojnë pikërisht rëndësinë e karakteristikave në formën e një peme, si dhe hierarkinë e tyre). Nga ana tjetër, në algoritme të tilla si Random Forest, LightGBM dhe XG Boost, shpesh përdoret diagrami i rëndësisë së karakteristikave, dmth. krijohet një diagram i variablave dhe "sasisë së rëndësisë së tyre". Kjo është veçanërisht e dobishme kur nevojitet të ofrohet një arsyetim i strukturuar për rëndësinë e karakteristikave nga pikëpamja e ndikimit të tyre në biznes.
Rregullimi
Rregullimi bëhet për të kontrolluar balancën midis paragjykimit (bias) dhe devijimit (variance). Paragjykimi tregon se sa mirë është përshtatur modeli në setin e të dhënave të stërvitjes. Devijimi tregon se sa të ndryshme ishin parashikimet midis seteve të trajnimit dhe testimit. Në mënyrë ideale, si paragjykimi ashtu edhe devijimi duhet të jenë të vogla. Këtu ndihmon rregullimi! Ekzistojnë dy teknikë kryesore:
Rregullimi L1 – Lasso: Lasso ndëshkon pesha e coeficientëve të modelit për të ndryshuar rëndësinë e tyre për modelin dhe madje mund t'i zerojë ato (dmth. të heqë këta variabla nga modeli përfundimtar). Zakonisht, Lasso përdoret nëse seti i të dhënave ka një numër të madh variablash dhe nevojitet përjashtimi i disa prej tyre për të kuptuar më mirë se si faktorët e rëndësishëm ndikojnë në model (dmth. ato karakteristika që janë zgjedhur nga Lasso dhe të cilat kanë rëndësi të caktuar).
Rregullimi L2 – metoda Ridge: Qëllimi i Ridge është të ruajë të gjithë variablat dhe në të njëjtën kohë t'u japë atyre rëndësi bazuar në kontributin në efikasitetin e modelit. Ridge do të jetë një zgjedhje e mirë nëse seti i të dhënave ka një numër të vogël variablash dhe të gjithë ata janë të nevojshëm për interpretime dhe rezultatet e arritura.
Duke qenë se Ridge lë të gjithë variablat, ndërsa Lasso përcakton më mirë rëndësinë e tyre, është zhvilluar një algoritëm që kombinon karakteristikat më të mira të të dyja rregullimeve dhe është i njohur si Elastic-Net.
Ka shumë mënyra të tjera për përzgjedhjen e karakteristikave për mësimin e automatik, por ideja kryesore mbetet gjithmonë e njëjta: të demonstrohet rëndësia e variablave dhe më pas të përjashtohen disa nga ata bazuar në rëndësinë e marrë. Rëndësia është një term shumë subjektiv, pasi nuk është një nivel, por një grup i të dhënave dhe diagrameve që mund të përdoren për të gjetur karakteristikat kyçe.
Faleminderit për leximin! Gëzime në mësim!
Burimi: habr.com
