9 AnsÀtze zur Erkennung von Anomalien

Im vorherigen Artikel Wir haben ĂŒber die Prognose von Zeitreihen gesprochen. Eine logische Fortsetzung wĂ€re ein Artikel ĂŒber die Erkennung von Anomalien.

Anwendung

Die Erkennung von Anomalien wird in Bereichen wie folgenden eingesetzt:

1) Vorhersage von MaschinenausfÀllen

So wurden im Jahr 2010 iranische Zentrifugen von dem Virus Stuxnet angegriffen, das den GerĂ€ten einen suboptimalen Betriebsmodus zuwies und dadurch Teile der AusrĂŒstung durch accelerated Wear außer Betrieb setzte.

Wenn bei den GerÀten Anomalieerkennungsalgorithmen verwendet worden wÀren, hÀtte man Situationen des Ausfalls vermeiden können.

9 AnsÀtze zur Erkennung von Anomalien

Die Suche nach Anomalien in der GerĂ€teleistung wird nicht nur in der Nuklearindustrie, sondern auch in der Metallurgie und bei Flugzeugturbinen eingesetzt. Und in anderen Bereichen, wo der Einsatz prĂ€diktiver Diagnostik gĂŒnstiger ist als die möglichen Verluste bei unvorhergesehenem Ausfall.

2) Vorhersage von Betrugshandlungen

Wenn von einer Karte, die Sie in Podolsk verwenden, Geld in Albanien abgehoben wird, sollte die Transaktion möglicherweise zusĂ€tzlich ĂŒberprĂŒft werden.

3) Erkennung anomalem Verbraucherverhalten

Wenn ein Teil der Kunden anomales Verhalten zeigt, gibt es möglicherweise ein Problem, von dem Sie nichts wissen.

4) Erkennung abnormaler Nachfrage und Last

Wenn die VerkĂ€ufe in einem FMCG-GeschĂ€ft unter die untere Grenze des Vertrauensintervalls der Prognose fallen, sollten Sie nach der Ursache dafĂŒr suchen.

AnsÀtze zur Anomalieerkennung

1) Ein-Klassen-SVM (One-Class SVM)

Eignet sich, wenn die Daten im Trainingssatz einer Normalverteilung folgen, wÀhrend der Testsatz Anomalien enthÀlt.

Der Ein-Klassen-SVM-Algorithmus konstruiert eine nichtlineare OberflÀche um den Ursprung. Es kann eine Trennlinie festgelegt werden, welche Daten als anormal betrachtet werden.

Basierend auf der Erfahrung unseres Teams von DATA4 ist der One-Class SVM der am hÀufigsten verwendete Algorithmus zur Lösung der Anomalieerkennungsaufgabe.

9 AnsÀtze zur Erkennung von Anomalien

2) Isolierender Wald – Isolation Forest

Beim 'zufĂ€lligen' Aufbau von BĂ€umen werden Ausreißer frĂŒh in BlĂ€tter platziert (in geringer Tiefe des Baumes), d.h. Ausreißer lassen sich einfacher 'isolieren'. Die Identifizierung anormaler Werte erfolgt in den ersten Iterationen des Algorithmus.

9 AnsÀtze zur Erkennung von Anomalien

3) Elliptischer UmhĂŒller und statistische Methoden

Wird verwendet, wenn die Daten normal verteilt sind. Je nÀher die Messung am Ende der Verteilungsmischung liegt, desto anomal ist der Wert.

Zu dieser Klasse gehören auch andere statistische Methoden.

9 AnsÀtze zur Erkennung von Anomalien

9 AnsÀtze zur Erkennung von Anomalien
Bild von der Website dyakonov.org

4) Metrische Methoden

Zu den Methoden gehören Algorithmen wie k nÀchster Nachbar, k-ten nÀchsten Nachbarn, ABOD (winkelbasierte Anomalieerkennung) oder LOF (lokaler Anomaliefaktor).

Geeignet, wenn der Abstand zwischen den Werten in den Merkmalen gleichwertig oder normiert ist (um nicht die Schlange in Papageien zu messen).

Der k-nĂ€chster-Nachbar-Algorithmus geht davon aus, dass normale Werte in einem bestimmten Bereich des mehrdimensionalen Raums liegen, und der Abstand zu den Anomalien grĂ¶ĂŸer ist als zu der trennenden HyperflĂ€che.

9 AnsÀtze zur Erkennung von Anomalien

5) Cluster-Methoden

Das Wesen der Cluster-Methoden besteht darin, dass, wenn ein Wert mehr als einen bestimmten Betrag von den Cluster-Zentren entfernt ist, der Wert als anomal betrachtet werden kann.

Es ist wichtig, den Algorithmus zu verwenden, der die Daten korrekt clusterisiert, was von der spezifischen Aufgabe abhÀngt.

9 AnsÀtze zur Erkennung von Anomalien

6) Hauptkomponentenanalyse

Geeignet, wo Richtungen mit der grĂ¶ĂŸten VarianzĂ€nderung identifiziert werden.

7) Algorithmen zur Vorhersage von Zeitreihen

Die Idee ist, dass, wenn ein Wert außerhalb des Vertrauensintervalls der Vorhersage liegt, er als anomal angesehen wird. FĂŒr die Vorhersage von Zeitreihen werden Algorithmen wie dreifache GlĂ€ttung, S(ARIMA), Boosting usw. verwendet.

Über Algorithmen zur Vorhersage von Zeitreihen wurde im vorherigen Artikel gesprochen.

9 AnsÀtze zur Erkennung von Anomalien

8) Überwachtes Lernen (Regression, Klassifikation)

Wenn die Daten es zulassen, verwenden wir Algorithmen von linearer Regression bis hin zu rekurrenten Netzwerken. Wir messen die Differenz zwischen der Vorhersage und dem tatsĂ€chlichen Wert und ziehen RĂŒckschlĂŒsse darauf, wie sehr die Daten von der Norm abweichen. Es ist wichtig, dass der Algorithmus ĂŒber ausreichende GeneralisierungsfĂ€higkeit verfĂŒgt und die Trainingsdaten keine anomalien Werte enthalten.

9) Modelltests

Wir nĂ€hern uns der Aufgabe der Anomalieerkennung als einer Empfehlungs-Problemstellung. Wir zerlegen unsere Merkmalsmatrix mithilfe von SVD oder Faktorisierungsmaschinen, und Werte in der neuen Matrix, die sich erheblich von den ursprĂŒnglichen unterscheiden, betrachten wir als anomal.

9 AnsÀtze zur Erkennung von Anomalien

Bild von der Website dyakonov.org

Fazit

In diesem Artikel haben wir die GrundansÀtze zur Anomalieerkennung betrachtet.

Die Suche nach Anomalien kann in vielerlei Hinsicht als Kunst betrachtet werden. Es gibt keinen perfekten Algorithmus oder Ansatz, dessen Anwendung alle Aufgaben löst. HÀufig wird eine Kombination von Methoden verwendet, um einen spezifischen Fall zu lösen. Die Anomalieerkennung erfolgt durch den Einsatz von One-Class Support Vector Machines, Isolation Forests, metrischen und Cluster-Methoden sowie unter Verwendung von Hauptkomponenten und Zeitreihenprognosen.

Wenn Sie andere Methoden kennen, schreiben Sie dies in die Kommentare zum Artikel.

Quelle: habr.com

60GB SSD 8Gb DDR4