Ensemble Learning'i maagia

Tere, Habr! Kutsume Data Engineer'e ja masinõppe spetsialiste tasuta demotunnile „ML mudelite juurutamine tööstuses veebipõhiste soovituste näitel“. Avaldame ka artikli Luca Monno — CDP SpA finantsanalüüsi juhi kohta.

Üks kõige kasulikumaid ja lihtsamaid masinõppe meetodeid on Ensemble Learning. Ensemble Learning on meetod, mis on aluseks XGBoostile, bagging'ule, juhuslikele metsadele ja paljudele teistele algoritmidele.

Towards Data Science'is on palju lahedaid artikleid, kuid ma valisin kaks lugu (esimene ja teine), mis mulle kõige rohkem meeldisid. Miks siis veel üks artikkel EL-ist kirjutada? Sest ma tahan näidata teile, kuidas see lihtsas näites töötab, mis aitas mul mõista, et siin ei ole mingit maagijat.

Kui ma esmakordselt nägin EL-i töötamas (töötades mitmete väga lihtsate regressioonimudelitega), ei suutnud ma oma silmi uskuda, ja mäletan siiani professorit, kes mind selle meetodi õpetas.

Mul oli kaks erinevat mudelit (kaks nõrka õppimisalgoritmi), mille tulemused olid out-of-sample R² on vast Corresponds to 0,90 ja 0,93. Enne tulemuste vaatamist arvasin, et saan R² kuskil kahe algväärtuse vahel. Teisisõnu, uskusin, et EL tuleb kasutada, et mudel töötaks halvemini kui halvim, kuid mitte nii hästi, kui parim mudel võiks töötada.

Minu suurimaks üllatuseks andis lihtne prognooside keskmistamine R² väärtuseks 0,95. 

Esiteks hakkasin otsima viga, kuid siis mõtlesin, et siin võib peituda mingi maagia!

Mis on Ensemble Learning

EL aitab ühendada kahte või enamat mudelit, et saada usaldusväärsem ja tõhusam mudel. Mudelite koos töötamiseks on olemas palju meetodeid. Siin käsitlen kahte kõige kasulikumat, et anda ülevaade.

Käesoleva abil regressioon saab keskmistada olemasolevate mudelite tulemusi.

Käesoleva abil klassifikatsioon saab anda mudelitele võimaluse valida silte. Silt, mida valiti kõige sagedamini – on see, mis valitakse uue mudeli poolt.

Miks EL töötab paremini

Peamine põhjus, miks EL töötab paremini, on see, et iga ennustuse puhul on viga (me teame seda tõenäosusteooriast), kahe ennustuse ühendamine võib aidata vähendada viga ja seetõttu parandada jõudlust (RMSE, R² jne).

Järgmine diagramm näitab, kuidas kaks nõrgemat algoritmi töötavad andmekogumiga. Esimese algoritmi kaldenurk on suurem kui vajalik, samas kui teisel on see peaaegu null (võib-olla ülemäära regulaarsuse tõttu). Kuid ensemble näitab palju paremat tulemust. 

Kui vaadata R² näitajat, siis esimese ja teise õppimisalgoritmi puhul on see vastavalt -0.01¹, 0.22, samas kui ansambli puhul on see 0.73.

Ensemble Learning'i maagia

On mitmeid põhjuseid, miks algoritm võib olla halva mudeli näide isegi sellise lihtsa näite nagu see: võib-olla otsustasite kasutada regulatsiooni, et vältida üleõppimist, või otsustasite mitte välistada teatud anomaaliaid; võib-olla kasutasite polünomiaalset regressiooni ja valisite vale astme (näiteks kasutasite teise astme polüümi, kui testandmetes on selge asümmeetria, millele sobiks paremini kolmas aste).

Millal EL töötab paremini

Vaadakem kaht treeningalgoritmi, mis töötavad sama andmestikuga.

Ensemble Learning'i maagia

Siin on näha, et kahe mudeli kombinatsioon ei parandanud oluliselt jõudlust. Alguses olid kahe treeningalgoritmi R² näitajad vastavalt -0,37 ja 0,22, samas kui ansambel saavutab -0,04. See tähendab, et EL mudel sai keskmise tulemuse.

Kuid nende kahe näite vahel on suur erinevus: esimeses näites olid mudelite vead negatiivselt korreleeritud, samas kui teises – positiivselt (kolme mudeli koefitsiente ei hinnatud, vaid autor valis need lihtsalt näitena).

Seega võib Ensemble Learning'i kasutada nihke/variatsioonide tasakaalu parandamiseks igal juhul, kuid kui mudelite vead ei ole positiivselt korrelatsioonis, võib EL'i kasutamine suurendada tootlikkust..

Homo- ja heterogeensed mudelid.

EL-i kasutatakse sageli homogeensetes mudelites (nagu antud näites või juhuslikus metsas), kuid tegelikult võite kombineerida erinevaid mudelite (lineaarne regressioon + närvivõrk + XGBoost) erinevate seletavate muutujate kogumitega. See toob tõenäoliselt kaasa korreleerimata vead ja tootlikkuse kasvu.

Võrdlus portfelli mitmekesistamisega.

EL töötab sarnaselt mitmekesistamisele portfelliteoorias, kuid seda paremini meie jaoks. 

Mitmekesistamise korral püüate vähendada oma näitajate variatsiooni, investeerides korreleerimata aktsiatesse. Hästi mitmekesistatud aktsiaportfell toob tulemuse, mis on parem kui halvim üksik aktsia, kuid mitte kunagi parem kui parim.

Citeerides Warren Buffett'i: 

«Divergeerimine on kaitse teadmatusest. Selle jaoks, kes ei tea, mida ta teeb, on see [divergeerimine] väga vähe mõtet.»

Masinõppes aitab EL vähendada teie mudeli dispersiooni, kuid see võib viia mudeli loomise, mille üldine jõudlus on parem kui parimal esialgsel mudelil.

Teeme kokkuvõtte

Mitme mudeli ühinemine üheks on suhteliselt lihtne meetod, mis võib aidata lahendada dispersiooni nihke probleemi ja suurendada jõudlust.

Kui teil on kaks või enam mudelit, mis töötavad hästi, ärge valige nende vahel: kasutage neid kõiki (aga ettevaatlikult)!

Kas oled huvitatud selle valdkonna arengust? Registreeru tasuta Demo-tundi „ML mudelite juurutamine tööstuses veebipõhiste soovituste näitel“ ja osalege internetikohtumisel Andrej Kuznetsoviga — Machine Learning Engineer Mail.ru Group'is.

Allikas: habr.com

Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid 🔥 Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid | ProHoster