Ein Fehler bei der BGP-Konfiguration führte zu einem 27-minütigen Ausfall der Cloudflare-Dienste.

Das Unternehmen Cloudflare, die ein Content Delivery Network für 27 Millionen Internetressourcen und verantwortlich für 13 % des Traffics von 1000 der größten Websites, hat Details zu dem Vorfall, bei dem für 27 Minuten die Funktionalität vieler Segmente des Cloudflare-Netzes gestört war, einschließlich derjenigen, die den Traffic nach London, Chicago, Los Angeles, Washington, Amsterdam, Paris, Moskau und St. Petersburg leiteten. Das Problem wurde durch eine falsche Konfigurationsänderung an einem Router in Atlanta verursacht. Während des Vorfalls, der am 17. Juli von 21:12 bis 21:39 (UTC) stattfand, sank das gesamte Trafficvolumen im Cloudflare-Netz um etwa 50 %.

Ein Fehler bei der BGP-Konfiguration führte zu einem 27-minütigen Ausfall der Cloudflare-Dienste.

Im Zuge technischer Arbeiten, um einen Teil des Traffics von einem der Backbones zu nehmen, löschten die Ingenieure eine Zeile im Einstellungsblock, der die Liste der über den Backbone empfangenen Routen definierte, die gemäß einer angegebenen Präfixliste gefiltert werden. Richtig wäre es gewesen, den gesamten Block zu deaktivieren, jedoch wurde fälschlicherweise nur die Zeile mit der Präfixliste gelöscht.

{master}[edit]
atl01# show | compare
[edit policy-options policy-statement 6-BBONE-OUT term 6-SITE-LOCAL from]
! inactive: prefix-list 6-SITE-LOCAL { … }

Inhalt des Blocks:

from {
prefix-list 6-SITE-LOCAL;
}
then {
local-preference 200;
community add SITE-LOCAL-ROUTE;
community add ATL01;
community add NORTH-AMERICA;
accept;
}

Durch die Entfernung der Bindung an die Präfixliste begann der verbleibende Block, auf alle Präfixe zu wirken, und der Router begann, all seine BGP-Routen an Router anderer Backbone-Netze zu verteilen. Zufällig hatten die neuen Routen eine höhere Priorität (local-preference 200) im Vergleich zur Priorität (100), die für andere Routen durch das automatische Traffic-Optimierungssystem festgelegt wurde. Infolgedessen kam es anstelle einer Entfernung der Routen mit dem Backbone zu einem Leak von höher priorisierten BGP-Routen, wodurch der Verkehr, der an andere Backbones gerichtet war, nach Atlanta geleitet wurde, was zur Überlastung des Routers und zum Zusammenbruch eines Teils des Netzwerks führte.

Ein Fehler bei der BGP-Konfiguration führte zu einem 27-minütigen Ausfall der Cloudflare-Dienste.

Um zukünftige Vorfälle dieser Art zu vermeiden, sind für Montag mehrere Änderungen an den Einstellungen der Cloudflare-Backbones geplant. Für die BGP-Sitzungen wird ein Limit für die maximale Anzahl der Präfixe (maximum-prefix) festgelegt, das den problematischen Backbone blockiert, falls zu viele Präfixe über ihn geroutet werden. Hätte dieses Limit früher eingeführt worden, hätte das betreffende Problem zur Abschaltung des Backbones in Atlanta geführt, jedoch nicht die gesamte Netzwerkinfrastruktur betroffen, da das Cloudflare-Netzwerk so konzipiert ist, dass es Ausfälle einzelner Backbones verkraftet. Bereits vorgenommene Änderungen umfassen eine Neubewertung der Präferenzen (local-preference) für lokale Routen, die verhindern, dass ein Router den Datenverkehr in anderen Teilen des Netzwerks beeinträchtigt.

Quelle: opennet.ru

Zuverlässiges Webhosting mit DDoS-Schutz, VPS- und VDS-Server kaufen 🔥 Zuverlässiges Webhosting mit DDoS-Schutz, VPS- und VDS-Server kaufen | ProHoster