¿Y si rompemos algo? Porque todo el tiempo estamos construyendo y reparando. Es mortalmente aburrido.
Rompamos de tal manera que no haya consecuencias — además, que nos alaben por este desorden. Luego reconstruiremos todo de manera que sea mucho mejor, más resistente y más rápido.
Y nuevamente romperemos.
¿Crees que es un concurso para utilizar la herramienta más secreta de toda nuestra astronáutica — el Gran Martillo Espacial Ruso?
No, es un intensivo en línea de SRE. Resulta que cada curso nunca se asemeja al anterior. Simplemente porque nunca se puede adivinar qué puede fallar, romperse, volverse lento, fallar de mil maneras y arruinar el humor de los ingenieros SRE de guardia en un sistema enorme y complejo al que se conectan miles y miles de usuarios cada segundo, y cuya audiencia total es de millones.
En diciembre llevaremos a cabo otro .

Haremos una pequeña retrospectiva. Recuerden cómo hace solo unos años los recursos humanos organizaban competiciones para ver quién conseguía más ingenieros DevOps. El premio ha cambiado. Ahora, como un sistema de vigilancia 'Pantsir-S1', observan el entorno buscando ingenieros SRE. Hablé en el artículo '‘, sobre cómo es la vida de un ingeniero SRE en Google, y cómo incluso tal corporación enfrenta una escasez de especialistas en SRE.
En el intensivo en línea en diciembre, durante tres días, de 10:00 a 19:00, aprenderás a garantizar el rendimiento, la resistencia y la disponibilidad de los sitios en condiciones de recursos limitados, a eliminar incidentes de TI y a realizar análisis postmortem para que los problemas no se repitan.
Ponentes del curso:
Ivan Kruglov. Ingeniero de Software en Databricks. Tiene experiencia en empresas de nivel empresarial en entrega y procesamiento de mensajes distribuidos, BigData y web-stack, búsqueda, construcción de nubes internas, servicio mesh.
Pavel Selivanov. Ingeniero DevOps Senior en Mail.ru Cloud Solutions. Con decenas de infraestructuras construidas y cientos de pipelines de CI/CD desarrollados. Administrador certificado de Kubernetes. Autor de varios cursos sobre Kubernetes y DevOps. Ponente habitual en conferencias de TI en Rusia y en el extranjero.
Todo será estricto, impredecible y práctico. Ustedes construirán, romperán y repararán, a menudo en secuencias muy diversas.
Construir: Ustedes tendrán que formular indicadores SLO, SLI, SLA para un sitio compuesto por varios microservicios; desarrollar la arquitectura e infraestructura que los sostengan; compilar, probar y desplegar el sitio; configurar la monitorización y las alertas.
Romper: Ustedes examinarán factores internos y externos que deterioran SLO: errores de desarrolladores, fallos de infraestructura, aumento de visitantes, ataques DoS. Aprenderán a comprender la resiliencia, el presupuesto de errores, las prácticas de pruebas, la gestión de interrupciones y la carga operativa.
Reparar: Serán entrenados para organizar rápida y eficazmente el trabajo del grupo encargado de eliminar la emergencia en el menor tiempo posible: involucrar a colegas, notificar a los interesados, establecer prioridades.
Estudiar: Podrán abordar el sitio desde la perspectiva de SRE. Analizará incidentes. Determinará cómo evitar que ocurran en el futuro: mejorar la monitorización, modificar la arquitectura, las metodologías de desarrollo y operación, los reglamentos. Automatizar procesos.
simula condiciones reales: el tiempo para restaurar la operatividad del servicio estará extremadamente limitado. Como en la vida real, como en una situación laboral real.
Puede consultar las condiciones del curso SRE y revisar el programa completo en .
El intensivo en línea está programado para diciembre de 2020. Para aquellos que paguen su participación por adelantado, hemos preparado un descuento.
¿Listos para un entrenamiento intenso, tareas no convencionales y emergencias inesperadas?
Simplemente, no será así. Habrá crecimiento profesional.
Fuente: habr.com
