Die Magie des Ensemble Learning

Hallo, Habr! Wir laden Data Engineers und Machine Learning-Spezialisten zu einer kostenlosen Demo-Stunde ein „Deployment von ML-Modellen in die Produktion am Beispiel von Online-Empfehlungen“. Außerdem veröffentlichen wir einen Artikel von Luca Monno – Head of Financial Analytics bei CDP SpA.

Eine der nützlichsten und einfachsten Methoden des Machine Learning ist das Ensemble Learning. Ensemble Learning ist die Grundlage für XGBoost, Bagging, Random Forest und viele andere Algorithmen.

Auf Towards Data Science gibt es viele interessante Artikel, aber ich habe zwei Geschichten ausgewählt (erster und zweiter), die mir am besten gefallen haben. Warum also noch einen weiteren Artikel über EL schreiben? Weil ich Ihnen zeigen möchte, wie es anhand eines einfachen Beispiels funktioniert, das mir klargemacht hat, dass es hierbei kein Geheimnis gibt.

Als ich EL zum ersten Mal in Aktion sah (bei der Arbeit mit mehreren sehr einfachen Regressionsmodellen), konnte ich meinen Augen nicht trauen, und ich erinnere mich immer noch an den Professor, der mir diese Methode beigebracht hat.

Ich hatte zwei verschiedene Modelle (zwei schwache Lernalgorithmen) mit Metriken out-of-sample R² beträgt 0,90 und 0,93. Bevor ich das Ergebnis ansah, dachte ich, dass ich ein R² irgendwo zwischen diesen beiden ursprünglichen Werten erhalten würde. Mit anderen Worten, ich ging davon aus, dass man EL nutzen kann, um sicherzustellen, dass das Modell nicht schlechter abschneidet als das schlechteste, aber auch nicht so gut wie das beste Modell.

Zu meinem größten Erstaunen ergaben die Ergebnisse der einfachen Mittelung der Vorhersagen ein R² von 0,95. 

Zuerst begann ich nach einem Fehler zu suchen, aber dann dachte ich, dass hier vielleicht etwas Magie im Spiel ist!

Was ist Ensemble Learning

Mit EL können die Vorhersagen von zwei oder mehr Modellen kombiniert werden, um ein zuverlässigeres und leistungsfähigeres Modell zu erhalten. Es gibt viele Methoden, um mit Ensemble-Modellen zu arbeiten. Hier werde ich zwei der nützlichsten ansprechen, um einen allgemeinen Überblick zu geben.

Mit Regression man kann die Ergebnisse bestehender Modelle mitteln.

Mit Klassifikation man kann den Modellen gestatten, Labels auszuwählen. Das Label, das am häufigsten ausgewählt wurde, wird von dem neuen Modell gewählt.

Warum funktioniert EL besser

Der Hauptgrund, warum das Ensemble-Learning besser funktioniert, liegt darin, dass jede Vorhersage einen Fehler aufweist (was wir aus der Wahrscheinlichkeitstheorie wissen). Die Kombination zweier Vorhersagen kann helfen, den Fehler zu reduzieren und somit die Leistungskennzahlen (RMSE, R² usw.) zu verbessern.

In der folgenden Grafik sieht man, wie zwei schwache Algorithmen mit einem Datensatz arbeiten. Der erste Algorithmus hat einen größeren Steigungskoeffizienten als nötig, während der zweite fast null ist (möglicherweise wegen Überregularisierung). Aber ensemble zeigt deutlich bessere Ergebnisse. 

Wenn man sich den R²-Wert anschaut, wird er für den ersten und zweiten Lernalgorithmus -0,01¹ und 0,22 betragen, während der Ensemble-Wert 0,73 beträgt.

Die Magie des Ensemble Learning

Es gibt zahlreiche Gründe, warum ein Algorithmus selbst an so einfachen Beispielen wie diesem eine schlechte Modellleistung zeigen kann: Möglicherweise haben Sie sich entschieden, Regularisierung zu verwenden, um Überanpassung zu vermeiden, oder Sie haben entschieden, bestimmte Anomalien nicht auszuschließen. Vielleicht haben Sie auch eine polynomialen Regression gewählt und den falschen Grad eingestellt (zum Beispiel einen Grad 2 verwendet, während die Testdaten eine deutliche Asymmetrie zeigen, für die ein Grad 3 besser geeignet gewesen wäre).

Wann funktioniert EL besser

Betrachten wir zwei Trainingsalgorithmen, die mit denselben Daten arbeiten.

Die Magie des Ensemble Learning

Hier ist zu erkennen, dass die Kombination der beiden Modelle die Leistung nicht wesentlich verbessert hat. Ursprünglich hatten die beiden Trainingsalgorithmen R²-Werte von -0,37 und 0,22, während der Ensemble-Algorithmus -0,04 erreichte. Das bedeutet, dass das EL-Modell einen Durchschnitt der Werte erzielt hat.

Es gibt jedoch einen großen Unterschied zwischen diesen beiden Beispielen: Im ersten Beispiel waren die Fehler der Modelle negativ korreliert, während sie im zweiten Beispiel positiv korreliert waren (die Koeffizienten der drei Modelle wurden nicht geschätzt, sondern nur vom Autor als Beispiel ausgewählt).

Daher kann Ensemble Learning verwendet werden, um das Verhältnis zwischen Verzerrung und Varianz in verschiedenen Fällen zu verbessern, jedoch, wenn die Fehler der Modelle nicht positiv korreliert sind, kann die Anwendung von EL zu einer Leistungssteigerung führen..

Homogene und heterogene Modelle

Sehr häufig wird EL mit homogenen Modellen eingesetzt (wie in diesem Beispiel oder im Random Forest), aber in Wirklichkeit können unterschiedliche Modelle (lineare Regression + neuronales Netzwerk + XGBoost) mit verschiedenen Erklärungsvariablen kombiniert werden. Dies wird wahrscheinlich zu unkorrelierten Fehlern führen und die Leistung verbessern.

Vergleich mit Portfoliodiversifikation

EL funktioniert ähnlich wie die Diversifizierung in der Portfoliotheorie, was für uns noch vorteilhafter ist. 

Bei der Diversifizierung versuchen Sie, die Varianz Ihrer Ergebnisse zu reduzieren, indem Sie in unkorrelierte Aktien investieren. Ein gut diversifiziertes Aktienportfolio wird eine Rendite erzielen, die besser ist als die schlechteste einzelne Aktie, aber niemals besser als die beste.

Zitat von Warren Buffett: 

„Diversifikation ist ein Schutz vor Unwissenheit; für den, der nicht weiß, was er tut, hat sie [Diversifikation] sehr wenig Sinn.“

In der Maschinenlernens hilft EL, die Varianz Ihres Modells zu reduzieren, aber es kann auch dazu führen, dass ein Modell entsteht, dessen allgemeine Leistung besser ist als die der besten ursprünglichen Modelle.

Fassen wir zusammen

Die Kombination mehrerer Modelle zu einem ist eine relativ einfache Methode, die zur Lösung des Bias-Varianz-Problems und zur Steigerung der Leistung führen kann.

Wenn Sie zwei oder mehr Modelle haben, die gut funktionieren, entscheiden Sie sich nicht zwischen ihnen: Verwenden Sie alle (aber mit Vorsicht)!

Möchten Sie sich in diesem Bereich weiterentwickeln? Melden Sie sich für eine kostenlose Demo-Stunde an „Deployment von ML-Modellen in die Produktion am Beispiel von Online-Empfehlungen“ und nehmen Sie teil an einem Online-Treffen mit Andrei Kuznetsov — Machine Learning Engineer bei Mail.ru Group.

Quelle: habr.com

Zuverlässiges Webhosting mit DDoS-Schutz, VPS- und VDS-Server kaufen 🔥 Zuverlässiges Webhosting mit DDoS-Schutz, VPS- und VDS-Server kaufen | ProHoster