Im Wir haben ĂŒber die Prognose von Zeitreihen gesprochen. Eine logische Fortsetzung wĂ€re ein Artikel ĂŒber die Erkennung von Anomalien.
Anwendung
Die Erkennung von Anomalien wird in Bereichen wie folgenden eingesetzt:
1) Vorhersage von MaschinenausfÀllen
So wurden im Jahr 2010 iranische Zentrifugen von dem Virus Stuxnet angegriffen, das den GerĂ€ten einen suboptimalen Betriebsmodus zuwies und dadurch Teile der AusrĂŒstung durch accelerated Wear auĂer Betrieb setzte.
Wenn bei den GerÀten Anomalieerkennungsalgorithmen verwendet worden wÀren, hÀtte man Situationen des Ausfalls vermeiden können.

Die Suche nach Anomalien in der GerĂ€teleistung wird nicht nur in der Nuklearindustrie, sondern auch in der Metallurgie und bei Flugzeugturbinen eingesetzt. Und in anderen Bereichen, wo der Einsatz prĂ€diktiver Diagnostik gĂŒnstiger ist als die möglichen Verluste bei unvorhergesehenem Ausfall.
2) Vorhersage von Betrugshandlungen
Wenn von einer Karte, die Sie in Podolsk verwenden, Geld in Albanien abgehoben wird, sollte die Transaktion möglicherweise zusĂ€tzlich ĂŒberprĂŒft werden.
3) Erkennung anomalem Verbraucherverhalten
Wenn ein Teil der Kunden anomales Verhalten zeigt, gibt es möglicherweise ein Problem, von dem Sie nichts wissen.
4) Erkennung abnormaler Nachfrage und Last
Wenn die VerkĂ€ufe in einem FMCG-GeschĂ€ft unter die untere Grenze des Vertrauensintervalls der Prognose fallen, sollten Sie nach der Ursache dafĂŒr suchen.
AnsÀtze zur Anomalieerkennung
1) Ein-Klassen-SVM (One-Class SVM)
Eignet sich, wenn die Daten im Trainingssatz einer Normalverteilung folgen, wÀhrend der Testsatz Anomalien enthÀlt.
Der Ein-Klassen-SVM-Algorithmus konstruiert eine nichtlineare OberflÀche um den Ursprung. Es kann eine Trennlinie festgelegt werden, welche Daten als anormal betrachtet werden.
Basierend auf der Erfahrung unseres Teams von DATA4 ist der One-Class SVM der am hÀufigsten verwendete Algorithmus zur Lösung der Anomalieerkennungsaufgabe.

2) Isolierender Wald â Isolation Forest
Beim 'zufĂ€lligen' Aufbau von BĂ€umen werden AusreiĂer frĂŒh in BlĂ€tter platziert (in geringer Tiefe des Baumes), d.h. AusreiĂer lassen sich einfacher 'isolieren'. Die Identifizierung anormaler Werte erfolgt in den ersten Iterationen des Algorithmus.

3) Elliptischer UmhĂŒller und statistische Methoden
Wird verwendet, wenn die Daten normal verteilt sind. Je nÀher die Messung am Ende der Verteilungsmischung liegt, desto anomal ist der Wert.
Zu dieser Klasse gehören auch andere statistische Methoden.


Bild von der Website dyakonov.org
4) Metrische Methoden
Zu den Methoden gehören Algorithmen wie k nÀchster Nachbar, k-ten nÀchsten Nachbarn, ABOD (winkelbasierte Anomalieerkennung) oder LOF (lokaler Anomaliefaktor).
Geeignet, wenn der Abstand zwischen den Werten in den Merkmalen gleichwertig oder normiert ist (um nicht die Schlange in Papageien zu messen).
Der k-nĂ€chster-Nachbar-Algorithmus geht davon aus, dass normale Werte in einem bestimmten Bereich des mehrdimensionalen Raums liegen, und der Abstand zu den Anomalien gröĂer ist als zu der trennenden HyperflĂ€che.

5) Cluster-Methoden
Das Wesen der Cluster-Methoden besteht darin, dass, wenn ein Wert mehr als einen bestimmten Betrag von den Cluster-Zentren entfernt ist, der Wert als anomal betrachtet werden kann.
Es ist wichtig, den Algorithmus zu verwenden, der die Daten korrekt clusterisiert, was von der spezifischen Aufgabe abhÀngt.

6) Hauptkomponentenanalyse
Geeignet, wo Richtungen mit der gröĂten VarianzĂ€nderung identifiziert werden.
7) Algorithmen zur Vorhersage von Zeitreihen
Die Idee ist, dass, wenn ein Wert auĂerhalb des Vertrauensintervalls der Vorhersage liegt, er als anomal angesehen wird. FĂŒr die Vorhersage von Zeitreihen werden Algorithmen wie dreifache GlĂ€ttung, S(ARIMA), Boosting usw. verwendet.
Ăber Algorithmen zur Vorhersage von Zeitreihen wurde im vorherigen Artikel gesprochen.

8) Ăberwachtes Lernen (Regression, Klassifikation)
Wenn die Daten es zulassen, verwenden wir Algorithmen von linearer Regression bis hin zu rekurrenten Netzwerken. Wir messen die Differenz zwischen der Vorhersage und dem tatsĂ€chlichen Wert und ziehen RĂŒckschlĂŒsse darauf, wie sehr die Daten von der Norm abweichen. Es ist wichtig, dass der Algorithmus ĂŒber ausreichende GeneralisierungsfĂ€higkeit verfĂŒgt und die Trainingsdaten keine anomalien Werte enthalten.
9) Modelltests
Wir nĂ€hern uns der Aufgabe der Anomalieerkennung als einer Empfehlungs-Problemstellung. Wir zerlegen unsere Merkmalsmatrix mithilfe von SVD oder Faktorisierungsmaschinen, und Werte in der neuen Matrix, die sich erheblich von den ursprĂŒnglichen unterscheiden, betrachten wir als anomal.

Bild von der Website dyakonov.org
Fazit
In diesem Artikel haben wir die GrundansÀtze zur Anomalieerkennung betrachtet.
Die Suche nach Anomalien kann in vielerlei Hinsicht als Kunst betrachtet werden. Es gibt keinen perfekten Algorithmus oder Ansatz, dessen Anwendung alle Aufgaben löst. HÀufig wird eine Kombination von Methoden verwendet, um einen spezifischen Fall zu lösen. Die Anomalieerkennung erfolgt durch den Einsatz von One-Class Support Vector Machines, Isolation Forests, metrischen und Cluster-Methoden sowie unter Verwendung von Hauptkomponenten und Zeitreihenprognosen.
Wenn Sie andere Methoden kennen, schreiben Sie dies in die Kommentare zum Artikel.
Quelle: habr.com
