Laten we iets breken? We zijn voortdurend aan het bouwen en repareren. Het is dodelijk saai.
Laten we het zo breken dat we er niets voor terugkrijgen — bovendien dat we zelfs geprezen worden voor deze chaos. En laten we daarna alles opnieuw bouwen — en dan zo dat het aanzienlijk beter, betrouwbaarder en sneller is.
En we breken het weer.
Denken jullie dat dit een competitie is voor het gebruik van het meest geheime gereedschap van onze ruimtevaart — de Grote Russische Ruimtehamer?
Nee, dit is een online intensieve training SRE. Zo is het namelijk dat elke cursus nooit en nooit hetzelfde is als de vorige. Gewoon omdat je nooit kunt voorspellen wat er in een enorm complex systeem kan misgaan, waar elke seconde duizenden gebruikers aansluiten en de totale audience miljoenen bedraagt; wat kan er falen, kapotgaan, vastlopen, glitches geven en op honderden andere manieren de SRE-engineers in de nachtdienst van hun humeur kan beroven.
In december houden we opnieuw een .

We zullen een korte terugblik doen. Denk aan hoe slechts enkele jaren geleden HR-wedstrijden organiseerde om zoveel mogelijk DevOps-engineers voor hun bedrijf te krijgen. De prijs is veranderd. Nu zijn ze, zoals het bewakingssysteem 'Pantzir-S1', aan het scannen van de omgeving, op zoek naar SRE-engineers. Ik heb geschreven in het artikel ‘’, hoe het leven als SRE-engineer bij Google is en hoe zelfs zo'n groot bedrijf tekortkomt aan SRE-specialisten.
Tijdens de online intensive training in december, gedurende drie dagen, van 10:00 tot 19:00, leer je hoe je de snelheid, betrouwbaarheid en beschikbaarheid van websites kunt waarborgen onder beperkte middelen, IT-incidenten kunt oplossen en post-mortems kunt houden zodat problemen zich niet herhalen.
Sprekers van de cursus:
Ivan Kruglov. Staff Software Engineer bij Databricks. Heeft ervaring in enterprise bedrijven op het gebied van gedistribueerde levering en verwerking van berichten, Big Data en web-stack, zoekmachine, opbouw van een interne cloud, service mesh.
Pavel Selivanov. Senior DevOps Engineer bij Mail.ru Cloud Solutions. Heeft tientallen infrastructuren opgebouwd en honderden CI/CD-pipelines geschreven. Gecertificeerd Kubernetes-beheerder. Auteur van verschillende cursussen over Kubernetes en DevOps. Regelmatig spreker op Russische en internationale IT-conferenties.
Alles zal streng, onvoorspelbaar en praktisch zijn. Je zult bouwen, breken en repareren — soms in de meest verschillende sequenties.
Bouwen: Je zult de SLO-, SLI- en SLA-parameters voor een website met meerdere microservices moeten formuleren; de architectuur en infrastructuur ontwikkelen die deze ondersteunen; de website bouwen, testen en implementeren; monitoring en alerting instellen.
Breken: Je zult de interne en externe factoren die de SLO verslechteren bekijken: fouten van ontwikkelaars, storingen in de infrastructuur, een toestroom van bezoekers, DoS-aanvallen. Je leert omgaan met veerkracht, error budget, testpraktijken, het beheren van onderbrekingen en operationele belasting.
Repareren: Je krijgt training om snel en effectief een team te organiseren voor het oplossen van incidenten in minimale tijd: collega's inschakelen, belanghebbenden informeren, prioriteiten stellen.
Bestuderen: Je zult de aanpak van de site vanuit een SRE-perspectief kunnen ontleden. Incidente-analyses uitvoeren. Bepalen hoe deze in de toekomst te vermijden: monitoring verbeteren, architectuur, ontwikkelings- en exploitatiebenaderingen en regelgeving aanpassen. Processen automatiseren.
simuleert echte omstandigheden — de tijd om de functionaliteit van de service te herstellen is strikt beperkt. Zoals in het echte leven, zoals in een echte werk situatie.
De voorwaarden van de SRE-cursus en het volledige programma zijn beschikbaar via .
Het online intensief is gepland voor december 2020. Voor degenen die hun deelname van tevoren betalen, hebben we een korting voorbereid.
Klaar voor intensieve training, ongewone taken en onverwachte incidenten?
Gewoon — dat zal er niet zijn. Er zal professionele groei zijn.
Bron: habr.com
