PĂ«rshĂ«ndetje, Habr! FtojmĂ« Data EngineerĂ« dhe specialistĂ« tĂ« Machine Learning pĂ«r njĂ« Demo-tregim falas . Dhe ne gjithashtu publikojmĂ« njĂ« artikull nga Luca Monno â Shefi i AnalitikĂ«s Financiare nĂ« CDP SpA.
Një nga metodat më të dobishme dhe më të thjeshta të mësimit të makinerive është Ensemble Learning. Ensemble Learning është një metodë në themel të XGBoost, Bagging, Pyllit të Rastësishëm dhe shumë algoritmave të tjerë.
Në Towards Data Science ka shumë artikuj interesantë, por unë zgjodha dy histori ( dhe ), që më pëlqyen më shumë. Pra, përse të shkruaj një tjetër artikull rreth EL? Sepse dua t'ju tregoj se si funksionon me një shembull të thjeshtë, i cili më bëri të kuptoj se këtu nuk ka asnjë magji.
Kur e pashë për herë të parë EL në veprim (në punën me disa modele regresionuese shumë të thjeshta) nuk mund të besoja sytë e mi, dhe ende e mbaj mend profesorin që më mësoi këtë metodë.
Kisha dy modele tĂ« ndryshme (dy algoritma tĂ« dobĂ«t tĂ« mĂ«simit) me tregues out-of-sample RÂČ tĂ« barabarta me 0,90 dhe 0,93 pĂ«rkatĂ«sisht. Para se tĂ« shihja rezultatin, mendova se do tĂ« merrja njĂ« RÂČ diku midis dy vlerave fillestare. NĂ« fjalĂ« tĂ« tjera, mendoja se EL mund tĂ« pĂ«rdorej pĂ«r tĂ« bĂ«rĂ« qĂ« modeli tĂ« punonte jo aq mirĂ« sa mĂ« i keqi, por as aq mirĂ« sa do tĂ« mund tĂ« punonte modeli mĂ« i mirĂ«.
PĂ«r habinĂ« time tĂ« madhe, rezultatet e thjeshta tĂ« mesatares sĂ« parashikimeve dhanĂ« njĂ« RÂČ prej 0,95.Â
Fillimisht nisa të kërkoja gabimin, por pastaj mendova se këtu mund të fshihej ndonjë magji!
ĂfarĂ« Ă«shtĂ« Ensemble Learning
Me EL mund të bashkohen parashikimet e dy ose më shumë modeleve për të marrë një model më të besueshëm dhe më produktiv. Ekzistojnë shumë metodologji për të punuar me ansamble modelesh. Këtu do të përmend dy më të dobishmet, për t'ju dhënë një përmbledhje.
Me ndihmën e regresioni mund të mesatarizojnë treguesit e modeleve ekzistuese.
Me ndihmĂ«n e klasifikimi mund t'u japĂ« modeleve mundĂ«sinĂ« pĂ«r tĂ« zgjedhur etiketat. Etiketa qĂ« u zgjodh mĂ« shpesh â ajo do tĂ« zgjidhet nga modeli i ri.
Pse EL punon më mirë
Arsyeja kryesore pse EL funksionon mĂ« mirĂ« Ă«shtĂ« se çdo parashikim ka njĂ« gabim (e dimĂ« kĂ«tĂ« nga teoria e probabilitetit); bashkimi i dy parashikimeve mund tĂ« ndihmojĂ« pĂ«r tĂ« zvogĂ«luar gabimin dhe, pĂ«r pasojĂ«, pĂ«rmirĂ«suar rezultatin e performancĂ«s (RMSE, RÂČ, etj.).
NĂ« diagramin e mĂ«poshtĂ«m, shihet si dy algoritme tĂ« dobĂ«t funksionojnĂ« me njĂ« set tĂ« dhĂ«nash. Algoritmi i parĂ« ka njĂ« koeficient kĂ«ndor mĂ« tĂ« madh se sa Ă«shtĂ« e nevojshme, ndĂ«rsa i dyti Ă«shtĂ« pothuajse zero (ndoshta pĂ«r shkak tĂ« mbisikurimit). Por ensemble tregon rezultate shumĂ« mĂ« tĂ« mira.Â
NĂ«se shikojmĂ« indikatorin RÂČ, atĂ«herĂ« pĂ«r algoritmĂ«t e parĂ« dhe tĂ« dytĂ« tĂ« tĂ« mĂ«suarit, ai do tĂ« jetĂ« -0.01Âč dhe 0.22, pĂ«rkatĂ«sisht, ndĂ«rsa pĂ«r ansamblin do tĂ« jetĂ« 0.73.

Ka shumë arsye pse një algoritëm mund të rezultojë një model i dobët, edhe në një shembull kaq të thjeshtë si ky: ndoshta keni vendosur të përdorni mbisikurim për të shmangur mbërritjen e modelit, ose keni vendosur të mos përjashtoni disa anomalitë, ose ndoshta keni përdorur regresion polinomial dhe keni zgjedhur gradën e gabuar (p.sh., përdorët polinom të gradës së dytë, ndërsa në të dhënat testuese ka një asimetrikë të dukshme, për të cilën do t'i përshtatej më mirë gradës së tretë).
Kur EL funksionon më mirë
Le të shqyrtojmë dy algoritme të të mësuarit që funksionojnë me të dhëna të njëjta.

KĂ«tu shihet se bashkimi i dy modeleve nuk e pĂ«rmirĂ«soi shumĂ« performancĂ«n. Fillimisht pĂ«r dy algoritmĂ«t e tĂ« mĂ«suarit, indikatorĂ«t RÂČ ishin -0.37 dhe 0.22, pĂ«rkatĂ«sisht, ndĂ«rsa pĂ«r ansamblin doli -0.04. Kjo do tĂ« thotĂ« se modeli EL mori njĂ« mesatare tĂ« treguesve.
Megjithatë, ka një ndryshim të madh midis këtyre dy shembujve: në shembullin e parë, gabimet e modeleve ishin negativisht të korrelacionuara, ndërsa në të dytin ishin pozitivisht (koeficientët e tre modeleve nuk u vlerësuan dhe thjesht u ndoqën si shembuj nga autori).
Prandaj, Mësimi me Ansambël mund të përdoret për të përmirësuar balancimin e devijimeve/dispersive në çdo rast, por kur gabimet e modeleve nuk janë pozitivisht të korrelacionuara, përdorimi i EL mund të çojë në përmirësimin e performancës.
Modelet homogjene dhe heterogjene
Shumë shpesh EL përdoret në modele homogjene (siç është këtu ose në pyjet rastësore), por në të vërtetë ju mund të kombinoni modele të ndryshme (regresioni linear + rrjeti neural + XGBoost) me grupe të ndryshme variablash shpjegues. Pothuajse përfundimisht kjo do të sjellë gabime të pa korrelacionuara dhe një rritje të performancës.
Krahasimi me diversifikimin e portofolit
EL funksionon nĂ« mĂ«nyrĂ« analogjike me diversifikimin nĂ« teorinĂ« e portofolit, por sa mĂ« shumĂ« informacion, aq mĂ« mirĂ« pĂ«r ne.Â
Me diversifikimin, ju përpiqeni të zvogëloni dispersinë e treguesve tuaj duke investuar në aksione të pa korrelacionuara. Një portofol aksionesh i mirë diversifikuar do të japë një tregues më të mirë se aksioni më i keq, por kurrë nuk do të jetë më i mirë se ai më i miri.
Duke cituar Warren Buffett:Â
âDiversifikimi Ă«shtĂ« mbrojtje nga injoranca, pĂ«r atĂ« qĂ« nuk di çfarĂ« po bĂ«n, ajo [diversifikimi] ka shumĂ« pak kuptim.â
Në mësimin e makinave, EL ndihmon për të reduktuar dispersinë e modelit tuaj, por kjo mund të çojë në krijimin e një modeli me performancë të përgjithshme më të mirë se modeli më i mirë origjinal.
Le të përmbledhim
Kombinimi i disa modeleve në një është një metodë relativisht e thjeshtë që mund të çojë në zgjidhjen e problemit të qëndrueshmërisë dhe një rritje të performancës.
Nëse keni dy ose më shumë modele që funksionojnë mirë, mos zgjidhni midis tyre: përdoreni të gjitha (por me kujdes)!
A Ă«shtĂ« interesante tĂ« zhvilloheni nĂ« kĂ«tĂ« drejtim? Regjistrohuni pĂ«r njĂ« mĂ«sim ProvĂ« falas dhe merrni pjesĂ« nĂ« â Inxhinier i MĂ«simit tĂ« Makinave nĂ« Mail.ru Group.
Burimi: habr.com
