Ensemble Learning'i maagia

Tere, Habr! Kutsume andmeid inseneride ja masinĂ”ppe spetsialiste tasuta demo-tunni. „ML mudelite viimine tööstuslikusse keskkonda veebipĂ”histe soovituste nĂ€itel“. Avaldame ka artikli Luca Monno – finantsanalĂŒĂŒtika juht CDP SpA-st.

Üks kasulikumaid ja lihtsamaid masinĂ”ppe meetodeid on Ensemble Learning. Ensemble Learning on meetod, mis seisab XGBoosti, bagging'i, juhuslike metsade ja paljude teiste algoritmide aluseks.

Towards Data Science'is on palju lahedaid artikleid, aga ma valisin kaks lugu (esmalt ja teine), mis mulle kĂ”ige rohkem meeldivad. Miks siis kirjutada veel ĂŒks artikkel EL-ist? Sest ma tahan nĂ€idata teile, kuidas see töötab lihtsa nĂ€ite abil, mis aitas mul mĂ”ista, et siin ei ole mingit maagilist.

Kui ma esmakordselt nÀgin EL-i toimimas (mÔnede vÀga lihtsate regressioonimudelitega), ei suutnud ma oma silmi uskuda ja mÀletan endiselt professorit, kes Ôpetas mulle seda meetodit.

Mul oli kaks erinevat mudelit (kaks nĂ”rka Ă”ppealgoritmi) RÂČ nĂ€itajatega out-of-sample 0,90 ja 0,93 vastavalt. Enne tulemuste vaatamist arvasin, et saan RÂČ kusagil kahe algse vÀÀrtuse vahel. TeisisĂ”nu, arvasin, et EL-i saab kasutada, et mudel töötaks mitte nii halvasti kui halvima mudeli puhul, kuid mitte nii hĂ€sti kui parim mudel vĂ”iks töötada.

Minu suurimaks ĂŒllatuseks andis lihtne ennustuste keskmistamine RÂČ vÀÀrtuseks 0,95. 

Esialgu hakkasin viga otsima, kuid siis mÔtlesin, et siin vÔib peituda mingi maagia!

Mis on Ensemble Learning

EL-i abil on vĂ”imalik kombineerida kahe vĂ”i enama mudeli ennustusi usaldusvÀÀrse ja vĂ”imeka mudeli saamiseks. Mudelite ansamblite töötamiseks on palju meetodeid. Siin kĂ€sitlen kahte kĂ”ige kasulikumat, et anda ĂŒldine ĂŒlevaade.

EL-i abil regressiooniga saab olemasolevate mudelite nÀitajaid keskmistada.

EL-i abil klassifitseerimisega saab mudelitele vÔimaldada sildistamist. KÔige sagedamini valitud silt on see, mille valib uus mudel.

Miks töötab EL paremini

Peamine pĂ”hjus, miks EL töötab paremini, seisneb selles, et iga ennustus sisaldab viga (me teame seda tĂ”enĂ€osusteooriast), kahe ennustuse kombineerimine aitab vĂ€hendada viga ja seega parandada tulemuslikkuse nĂ€itajaid (RMSE, RÂČ jne).

JĂ€rgmises diagrammis on nĂ€idatud, kuidas kaks nĂ”rka algoritmi töötavad andme kogumiga. Esimese algoritmi nurkkoefitsient on suurem kui vajalik, samas kui teisel on see peaaegu null (vĂ”ib-olla ĂŒlemÀÀrase regulatsiooni tĂ”ttu). Aga ansambel nĂ€itab tulemust palju paremini. 

RÂČ nĂ€itaja osas on esimese ja teise koolitusalgoritmi vÀÀrtused vastavalt -0,01Âč ja 0,22, samas kui ansambli nĂ€itaja on 0,73.

Ensemble Learning'i maagia

On palju pĂ”hjusi, miks algoritm vĂ”ib osutuda kehvaks mudeliks isegi sellisel lihtsal puhul nagu see: vĂ”ib-olla otsustasite kasutada regulatsiooni, et vĂ€ltida ĂŒleĂ”ppimist, vĂ”i otsustasite mitte vĂ€lja jĂ€tta mĂ”ningaid anomaaliaid, vĂ”i vĂ”ib-olla kasutasite polĂŒnomiaalset regressiooni ja valisite vale astme (nĂ€iteks kasutasite teise astme polĂŒnoomi, samas kui testandmetes on ilmselge asĂŒmmeetria, mille jaoks sobiks paremini kolmas aste).

Kui EL töötab paremini

Vaatame kahte koolitusalgoritmi, mis töötavad sama andmekogumiga.

Ensemble Learning'i maagia

Siit on nĂ€ha, et kahe mudeli ĂŒhendamine ei parandanud oluliselt tulemuslikkust. Alguses olid kahe koolitusalgoritmi RÂČ nĂ€itajad vastavalt -0,37 ja 0,22, ansambli puhul aga -0,04. See tĂ€hendab, et EL mudel sai keskmise nĂ€itajate vÀÀrtuse.

Kuid nende kahe nĂ€ite vahel on suur erinevus: esimeses nĂ€ites olid mudelite vead negatiivselt korreleeritud, samas kui teises – positiivselt (kolme mudeli koefitsiente ei hinnatud, vaid autor valis need nĂ€itena).

Seega vÔib Ensemble Learningit kasutada nihke/dispersiooni tasakaalu parandamiseks igasugustes olukordades, kuid kui mudelite vead ei ole positiivselt korreleeritud, vÔib ELi kasutamine viia tulemuslikkuse tÔusuni..

Homoskeemilised ja heterogeensed mudelid

EL-i kasutamine on vĂ€ga sage ĂŒhtsete mudelite puhul (nagu antud nĂ€ites vĂ”i juhuslikus metsas), kuid tegelikult saate kombineerida erinevaid mudelit (lineaarne regressioon + tehisnĂ€rvivĂ”rk + XGBoost) erinevate seletavate muutujate kogumitega. TĂ”enĂ€oliselt toob see kaasa mittekorreleeritud vigu ja jĂ”udluse paranemise.

VÔrdlemine portfelli hajutamisega

EL töötab analoogselt hajutamise teooriaga, kuid see on meie jaoks veel parem. 

Hajutamisel pĂŒĂŒate vĂ€hendada oma nĂ€itajate dispersiooni, investeerides mittekorreleeritud aktsiatesse. HĂ€sti hajutatud aktsiaportfell annab tulemuse, mis on parem kui halvim eraldi aktsia, kuid mitte kunagi parem kui parim.

Citeerides Warren Buffet't: 

„Hajutamine on kaitse teadmatusest, ja neile, kes ei tea, mida teevad, on see [hajutamine] vĂ€ga vĂ€he mĂ”tet.”

MasinĂ”ppes aitab EL vĂ€hendada teie mudeli dispersiooni, kuid see vĂ”ib viia mudeli loomise, mille ĂŒldine tulemuslikkus on parem kui parimal algsel mudelil.

Teeme kokkuvÔtte

Mitme mudeli ĂŒhendamine ĂŒheks on suhteliselt lihtne meetod, mis vĂ”ib lahendada dispersiooni kallutatuse probleemi ja parandada tulemuslikkust.

Kui teil on kaks vÔi enam mudelit, mis toimivad hÀsti, Àrge valige nende vahel: kasutage kÔiki (aga olge ettevaatlik)!

Kas on huvitav selles suunas areneda? Registreeruge tasuta demo-tunniks „ML mudelite viimine tööstuslikusse keskkonda veebipĂ”histe soovituste nĂ€itel“ ja osalege online-kohtumisel Andrei Kuznetsoviga — MasinĂ”ppe insener Mail.ru Group'is.

Allikas: habr.com

Osta usaldusvÀÀrne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid đŸ”„ Osta usaldusvÀÀrne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid | ProHoster