L'azienda Cloudflare, una rete di distribuzione dei contenuti per 27 milioni di risorse online e che gestisce il traffico del 13% dei 1000 principali siti web, i dettagli dell'incidente durante il quale il funzionamento di molti segmenti della rete Cloudflare è stato interrotto per 27 minuti, comprese le sezioni responsabili della distribuzione del traffico a Londra, Chicago, Los Angeles, Washington, Amsterdam, Parigi, Mosca e San Pietroburgo. Il problema è stato causato da una modifica errata della configurazione su un router ad Atlanta. Durante l'incidente, avvenuto il 17 luglio dalle 21:12 alle 21:39 (UTC), il volume totale del traffico nella rete Cloudflare è diminuito di circa il 50%.
Durante i lavori tecnici, per ridurre parte del traffico su uno dei backbone, gli ingegneri hanno rimosso una riga nel blocco di impostazioni che definiva l'elenco delle rotte accettate attraverso il backbone, filtrate in base all'elenco di prefissi specificato. La cosa corretta sarebbe stata disattivare l'intero blocco, ma per errore è stata rimossa solo la riga con l'elenco dei prefissi.
{master}[modifica]
atl01# mostra | confronta
[modifica opzioni politica dichiarazione politica 6-BBONE-OUT termine 6-SITO-LOCALE da]
! inattivo: lista-prefissi 6-SITO-LOCALE { … }
Contenuto del blocco:
da {
lista-prefissi 6-SITO-LOCALE;
}
poi {
preferenza-locale 200;
comunità add SITO-LOCALE-ROUTE;
comunità add ATL01;
comunità add AMERICA-NORD;
accetta;
}
A causa della rimozione del legame con l'elenco dei prefissi, la parte rimanente del blocco ha iniziato a diffondersi a tutti i prefissi e il router ha iniziato a inviare tutte le proprie rotte BGP ai router di altri backbone. Per una coincidenza, le nuove rotte avevano una priorità più alta (preferenza-locale 200) rispetto alla priorità (100) assegnata ad altre rotte dal sistema automatico di ottimizzazione del traffico. Di conseguenza, invece di rimuovere il routing dal backbone, si è verificata una fuga di rotte BGP con priorità più alta, portando il traffico destinato ad altri backbone ad essere diretto ad Atlanta, causando il sovraccarico del router e il collasso di parte della rete.
Per evitare che tali incidenti si verifichino in futuro, lunedì sono previsti alcuni cambiamenti alle impostazioni dei backbone di Cloudflare. Verrà aggiunto un limite al numero massimo di prefissi (maximum-prefix) per le sessioni BGP, che bloccherà il backbone problematico nel caso venga indirizzato un numero eccessivo di prefissi attraverso di esso. Se questo limite fosse stato implementato in precedenza, il problema considerato avrebbe causato l'interruzione del backbone ad Atlanta, senza però impattare sul funzionamento dell'intera rete, poiché la rete Cloudflare è progettata per gestire il guasto di singoli backbone. Tra le modifiche già apportate, si segnala la revisione delle priorità (local-preference) per i percorsi locali, che impedirà a un singolo router di influenzare il traffico in altre parti della rete.
Fonte: opennet.ru
