E se rompessimo qualcosa? Siamo sempre a costruire e riparare. È una noia mortale.
Rompiamolo in modo che non ci siano conseguenze — anzi, che ci lodino per questo comportamento. Poi ricostruiremo tutto — e lo faremo in modo che sia decisamente migliore, più resistente ai guasti e più veloce.
E rompiamo di nuovo.
Pensate che sia una competizione per usare lo strumento più segreto di tutta la nostra cosmonautica — il Grande Martello Spaziale Russo?
No, è un'intensivo online SRE. È successo che ogni corso sia completamente diverso dai precedenti. Semplicemente perché non si può mai prevedere cosa possa guastarsi, rompersi, rallentare, bloccarsi, e in centinaia di modi rovinare l'umore del turno degli ingegneri SRE, in un enorme sistema complesso a cui ogni secondo si connettono migliaia e migliaia di utenti, e con un pubblico che ammonta a diversi milioni.
A dicembre organizzeremo un altro .

Faremo una piccola retrospettiva. Ricordate come solo qualche anno fa gli HR organizzavano competizioni per vedere chi riusciva a portare più ingegneri DevOps nella propria azienda. Il premio è cambiato. Ora, come un sistema di sorveglianza "Pancir-S1", scrutando l'ambiente circostante, cercano ingegneri SRE. Ho parlato nell'articolo "», di come vive un ingegnere SRE in Google, e di come anche una grande corporation faccia fronte a una carenza di specialisti SRE.
Nell'intensivo online di dicembre, in tre giorni, dalle 10:00 alle 19:00, imparerete a garantire le prestazioni, la resilienza e la disponibilità dei siti in condizioni di risorse limitate, a risolvere incidenti IT e a condurre analisi post-mortem per evitare che i problemi si ripetano.
Relatori del corso:
Ivan Kruglov. Staff Software Engineer in Databricks. Ha esperienza in aziende enterprise nella distribuzione e elaborazione di messaggi, Big Data e web stack, nella costruzione di cloud privati e nel service mesh.
Pavel Selivanov. Senior DevOps Engineer in Mail.ru Cloud Solutions. Ha costruito decine di infrastrutture e centinaia di pipeline CI/CD. Amministratore certificato Kubernetes. Autore di diversi corsi su Kubernetes e DevOps. Relatore regolare in conferenze IT russe e internazionali.
Tutto si svolgerà in modo severo, imprevedibile e pratico. Dovrete costruire, distruggere e riparare — a volte in sequenze molto diverse.
Costruire: Dovrete formulare indicatori SLO, SLI, SLA per un sito composto da diversi microservizi; sviluppare un'architettura e un'infrastruttura che li supporti; raccogliere, testare e distribuire il sito; impostare il monitoraggio e l'allerta.
Distruggere: Esaminerete i fattori interni ed esterni che degradano gli SLO: errori degli sviluppatori, guasti infrastrutturali, affluenza di visitatori, attacchi DoS. Imparerete a comprendere la resilienza, il budget per gli errori, le pratiche di testing, la gestione delle interruzioni e la carico operativo.
Riparare: Saranno addestrati a organizzare rapidamente ed efficacemente il lavoro del gruppo per risolvere incidenti nel minor tempo possibile: coinvolgere i colleghi, informare gli stakeholders, stabilire le priorità.
Studiare: Potrete analizzare l'approccio al sito dal punto di vista SRE. Analizzare gli incidenti. Stabilire come evitarli in futuro: migliorare il monitoraggio, modificare l'architettura, approcci allo sviluppo e operazioni, regolamenti. Automatizzare i processi.
simula condizioni reali — il tempo per ripristinare il funzionamento del servizio sarà estremamente limitato. Come nella vita reale, come in una situazione lavorativa reale.
Puoi scoprire i requisiti del corso SRE e consultare il programma completo a .
L'intensivo online è programmato per dicembre 2020. Per coloro che pagano in anticipo, abbiamo preparato uno sconto.
Sei pronto per un'intensa formazione, compiti non convenzionali e imprevisti?
Semplice — non sarà. Ci sarà crescita professionale.
Fonte: habr.com
