Che ne dite di rompere qualcosa? Stiamo sempre costruendo e riparando. È noioso da morire.
Rompere in modo tale da non avere conseguenze — e non solo, ma anche per essere lodati per questa follia. E poi ricostruiremo tutto — in modo che diventi nettamente migliore, più resistente e più veloce.
E romperemo di nuovo.
Pensate che sia una competizione per utilizzare lo strumento più segreto di tutta la nostra astronautica — il Grande Martello Spaziale Russo?
No, è un intensivo online SRE. È così che funziona, ogni corso non è mai e poi mai simile al precedente. Semplicemente perché non puoi mai indovinare cosa in un enorme e complesso sistema, a cui si connettono migliaia e migliaia di utenti ogni secondo, e il pubblico stesso è composto da milioni, può guastarsi, rompersi, rallentare, bloccarsi e in centinaia di modi rovinare l'umore del turno di SRE-ingegneri.
A dicembre svolgeremo un altro .

Facciamo una piccola retrospettiva. Ricordate come, solo qualche anno fa, i responsabili delle risorse umane si sfidavano per accaparrarsi quanti più ingegneri DevOps possibile. Il premio è cambiato. Ora, come un sistema di sorveglianza "Pantsir-S1", ispezionano l'ambiente circostante, cercando ingegneri SRE. Ho parlato nell'articolo "come vive un ingegnere SRE in Google e come anche un'azienda del genere sente la mancanza di specialisti SRE.
Nel corso intensivo online di dicembre, in tre giorni, dalle 10:00 alle 19:00, imparerai a garantire prestazioni, resilienza e disponibilità dei siti in condizioni di risorse limitate, a gestire incidenti IT e a condurre analisi postmortem in modo tale che i problemi non si ripetano.
Relatori del corso:
Ivan Kruglov. Staff Software Engineer presso Databricks. Ha esperienza in aziende enterprise nella distribuzione e nel trattamento di messaggi, Big Data e web stack, nella ricerca, nella creazione di cloud interni e nel service mesh.
Pavel Selivanov. Senior DevOps Engineer in Mail.ru Cloud Solutions. Ha all'attivo decine di infrastrutture costruite e centinaia di pipeline CI/CD scritte. Amministratore Kubernetes certificato. Autore di diversi corsi su Kubernetes e DevOps. Relatore regolare a conferenze IT russe e internazionali.
Tutto si svolgerà in modo rigoroso, imprevedibile e pratico. Costruirete, romperete e riparerete — a volte in sequenze molto diverse.
Costruire: Dovrete formulare indicatori SLO, SLI, SLA per un sito composto da più microservizi; sviluppare architettura e infrastruttura che li supporti; raccogliere, testare e distribuire il sito; configurare monitoraggio e alerting.
Romperete: Esaminerete i fattori interni ed esterni che compromettono gli SLO: errori degli sviluppatori, guasti infrastrutturali, afflusso di visitatori, attacchi DoS. Imparerete a comprendere la resilienza, il budget degli errori, le pratiche di test, la gestione delle interruzioni e il carico operativo.
Riparare: Sarai addestrato a organizzare rapidamente ed efficacemente il lavoro di un team di gestione delle emergenze: coinvolgere i colleghi, informare gli stakeholder, stabilire priorità.
Studiare: Potrai esaminare l'approccio al sito dal punto di vista SRE. Analizzare gli incidenti. Determinare come evitarli in futuro: migliorare il monitoraggio, modificare l'architettura, gli approcci allo sviluppo e all'operazione, le normative. Automatizzare i processi.
simula condizioni reali: il tempo per ripristinare la funzionalità del servizio sarà estremamente limitato. Proprio come nella vita reale, in una situazione lavorativa reale.
Puoi trovare i dettagli del corso SRE e studiare il programma completo su .
L'intensivo online è programmato per dicembre 2020. Per chi paga in anticipo, abbiamo preparato uno sconto.
Sei pronto per un'esperienza di apprendimento intensa, compiti non convenzionali e emergenze inaspettate?
Facile – non lo sarà. Ci sarà crescita professionale.
Fonte: habr.com
