Un errore nella configurazione del BGP ha causato un'interruzione di 27 minuti nel servizio di Cloudflare

La società Cloudflare, che fornisce una rete di distribuzione dei contenuti per 27 milioni di siti web e gestisce il traffico del 13% delle 1000 più grandi piattaforme, ha rivelato i dettagli di un incidente che ha compromesso il funzionamento di molti segmenti della rete Cloudflare per 27 minuti, inclusi quelli responsabili della distribuzione del traffico a Londra, Chicago, Los Angeles, Washington, Amsterdam, Parigi, Mosca e San Pietroburgo. Il problema è stato causato da una configurazione errata su un router ad Atlanta. Durante l'incidente, avvenuto il 17 luglio dalle 21:12 alle 21:39 (UTC), il volume totale del traffico nella rete Cloudflare è diminuito di circa il 50%.

Un errore nella configurazione del BGP ha causato un'interruzione di 27 minuti nel servizio di Cloudflare

Durante i lavori di manutenzione, con l'intento di ridurre parte del traffico da uno dei backbone, gli ingegneri hanno cancellato una riga in un blocco di impostazioni che definiva l'elenco dei percorsi accettati tramite il backbone, filtrati in base all'elenco di prefissi specificato. La cosa corretta sarebbe stata disattivare l'intero blocco, ma è stata erroneamente cancellata solo la riga relativa all'elenco dei prefissi.

{master}[edit]
atl01# show | compare
[edit policy-options policy-statement 6-BBONE-OUT term 6-SITE-LOCAL from]
! inactive: prefix-list 6-SITE-LOCAL { … }

Contenuto del blocco:

from {
prefix-list 6-SITE-LOCAL;
}
then {
local-preference 200;
community add SITE-LOCAL-ROUTE;
community add ATL01;
community add NORTH-AMERICA;
accept;
}

A causa della rimozione del vincolo dalla lista dei prefissi, il resto del blocco ha cominciato a propagarsi a tutti i prefissi e il router ha iniziato a inviare tutti i suoi percorsi BGP ai router di altri backbone. Per una coincidenza, i nuovi percorsi avevano una priorità più alta (local-preference 200) rispetto alla priorità (100) impostata per gli altri percorsi dal sistema automatico di ottimizzazione del traffico. Di conseguenza, invece di rimuovere il routing dal backbone, si è verificata una fuga di percorsi BGP di maggiore priorità, portando al traffico, destinato ad altri backbone, a dirigersi verso Atlanta, il che ha causato un sovraccarico del router e il collasso di parte della rete.

Un errore nella configurazione del BGP ha causato un'interruzione di 27 minuti nel servizio di Cloudflare

Per prevenire il verificarsi di incidenti simili in futuro, lunedì sono previsti alcuni cambiamenti nelle impostazioni dei backbone di Cloudflare. Per le sessioni BGP sarà impostato un limite sul numero massimo di prefissi (maximum-prefix), che bloccherà il backbone problematico nel caso venga instradato un numero eccessivo di prefissi. Se questo limite fosse stato imposto in precedenza, il problema in questione avrebbe causato la disattivazione del backbone ad Atlanta, ma non avrebbe influito sul funzionamento dell'intera rete, poiché la rete Cloudflare è progettata per consentire il guasto di singoli backbone. Tra le modifiche già adottate, si segnala la revisione delle priorità (local-preference) per i percorsi locali, che impedirà a un router di influenzare il traffico in altre parti della rete.

Fonte: opennet.ru

Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster