Un error en la configuración de BGP causó una interrupción de 27 minutos en el servicio de Cloudflare

La empresa Cloudflare, que proporciona una red de entrega de contenido para 27 millones de recursos de Internet y que maneja el 13% del tráfico de los 1000 sitios más grandes, reveló detalles del incidente que interrumpió el funcionamiento de muchos segmentos de la red de Cloudflare durante 27 minutos, incluidos aquellos responsables de la entrega de tráfico a Londres, Chicago, Los Ángeles, Washington, Ámsterdam, París, Moscú y San Petersburgo. El problema fue causado por un cambio de configuración incorrecto en un enrutador en Atlanta. Durante el incidente, que ocurrió el 17 de julio de 21:12 a 21:39 (UTC), el volumen total de tráfico en la red de Cloudflare disminuyó aproximadamente en un 50%.

Un error en la configuración de BGP causó una interrupción de 27 minutos en el servicio de Cloudflare

Durante el mantenimiento técnico, con el objetivo de reducir parte del tráfico de uno de los backbones, los ingenieros eliminaron una línea en el bloque de configuración que define la lista de rutas aceptadas a través del backbone, filtradas según la lista de prefijos especificada. Lo correcto habría sido desactivar todo el bloque, pero por error solo se eliminó la línea con la lista de prefijos.

{master}[edit]
atl01# show | compare
[edit policy-options policy-statement 6-BBONE-OUT term 6-SITE-LOCAL from]
! inactive: prefix-list 6-SITE-LOCAL { … }

Contenido del bloque:

from {
prefix-list 6-SITE-LOCAL;
}
then {
local-preference 200;
community add SITE-LOCAL-ROUTE;
community add ATL01;
community add NORTH-AMERICA;
accept;
}

Debido a la eliminación del enlace a la lista de prefijos, la parte restante del bloque comenzó a propagarse a todos los prefijos y el enrutador comenzó a enviar todas sus rutas BGP a enrutadores de otros backbones. Por coincidencia, las nuevas rutas tenían una prioridad más alta (local-preference 200) en comparación con la prioridad (100) asignada a otras rutas por el sistema automático de optimización de tráfico. En consecuencia, en lugar de eliminar la enrutación del backbone, se produjo una fuga de rutas BGP de mayor prioridad, lo que causó que el tráfico destinado a otros backbones se dirigiera a Atlanta, lo que condujo a la sobrecarga del enrutador y al colapso de parte de la red.

Un error en la configuración de BGP causó una interrupción de 27 minutos en el servicio de Cloudflare

Para evitar la repetición de incidentes similares en el futuro, el lunes se planean realizar varios cambios en la configuración de los backbones de Cloudflare. Se añadirá un límite al número máximo de prefijos (maximum-prefix) para las sesiones BGP, que bloqueará el backbone problemático si se dirige a través de él un número excesivo de prefijos. Si este límite se hubiera añadido anteriormente, el problema considerado habría provocado la desconexión del backbone en Atlanta, pero no habría afectado el funcionamiento de toda la red, ya que la red de Cloudflare está diseñada para permitir fallos en backbones individuales. Entre los cambios ya implementados se destaca la revisión de las prioridades (local-preference) para las rutas locales, lo que impedirá que un enrutador influya en el tráfico de otras partes de la red.

Fuente: opennet.ru

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster