Une erreur lors de la configuration du BGP a entraîné une interruption de 27 minutes du service Cloudflare.

L'entreprise Cloudflare, qui fournit un réseau de diffusion de contenu pour 27 millions de ressources Internet et gère 13 % du trafic des 1000 plus grands sites, a révélé fournit des détails sur l'incident, lors duquel le fonctionnement de nombreux segments du réseau Cloudflare a été interrompu pendant 27 minutes, y compris ceux responsables de la diffusion du trafic vers Londres, Chicago, Los Angeles, Washington, Amsterdam, Paris, Moscou et Saint-Pétersbourg. Le problème a été causé par une mauvaise modification de la configuration sur un routeur à Atlanta. Pendant l'incident, qui s'est produit le 17 juillet de 21h12 à 21h39 (UTC), le volume total de trafic sur le réseau Cloudflare a diminué d'environ 50%.

Une erreur lors de la configuration du BGP a entraîné une interruption de 27 minutes du service Cloudflare.

Au cours des travaux techniques, dans le but de soulager une partie du trafic sur l'un des backbones, les ingénieurs ont supprimé une ligne du bloc de paramètres définissant la liste des itinéraires acceptés via le backbone, filtrés selon une liste de préfixes fournie. Il aurait été correct de désactiver tout le bloc, mais une erreur a abouti à la suppression de seulement la ligne contenant la liste des préfixes.

{master}[edit]
atl01# show | compare
[edit policy-options policy-statement 6-BBONE-OUT term 6-SITE-LOCAL from]
! inactive: prefix-list 6-SITE-LOCAL { … }

Contenu du bloc :

from {
prefix-list 6-SITE-LOCAL;
}
then {
local-preference 200;
community add SITE-LOCAL-ROUTE;
community add ATL01;
community add NORTH-AMERICA;
accept;
}

En raison de la suppression du lien avec la liste de préfixes, le reste du bloc a commencé à s'appliquer à tous les préfixes, et le routeur a commencé à diffuser tous ses itinéraires BGP vers d'autres routeurs de backbones. Par coïncidence, les nouveaux itinéraires avaient une priorité plus élevée (local-preference 200) par rapport à la priorité (100) attribuée aux autres itinéraires par le système automatique d'optimisation du trafic. Au lieu de retirer le routage du backbone, une fuite d'itinéraires BGP de plus haute priorité s'est produite, entraînant le rediriger du trafic destiné à d'autres backbones vers Atlanta, ce qui a provoqué une surcharge du routeur et l'effondrement d'une partie du réseau.

Une erreur lors de la configuration du BGP a entraîné une interruption de 27 minutes du service Cloudflare.

Pour éviter que de tels incidents ne se reproduisent à l'avenir, plusieurs modifications des paramètres de backbone de Cloudflare sont prévues pour lundi. Pour les sessions BGP, une limite sur le nombre maximum de préfixes (maximum-prefix) sera ajoutée, ce qui bloquera le backbone problématique en cas d'acheminement d'un trop grand nombre de préfixes. Si cette limite avait été mise en place plus tôt, le problème en question aurait conduit à l'interruption du backbone à Atlanta, mais n'aurait pas eu d'impact sur le fonctionnement de l'ensemble du réseau, car le réseau Cloudflare est conçu pour permettre la défaillance de certains backbones. Parmi les changements déjà adoptés, on note le réexamen des priorités (local-preference) pour les routes locales, ce qui empêchera un routeur d'influencer le trafic dans d'autres parties du réseau.

Source : opennet.ru

Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster