Cosa facciamo
Definiamo cosa vuol dire “funziona”. Scegliamo i pochi percorsi utente che contano davvero, come la registrazione, il pagamento o il caricamento della dashboard. Poi fissiamo degli obiettivi di servizio (SLO): quanto veloce, quante volte va a buon fine, misurato dove l’utente lo percepisce. Diventano i numeri su cui il team discute, invece delle opinioni.
Diamo un senso agli alert. Teniamo solo gli alert che segnalano un impatto sugli utenti o un error budget che si consuma troppo in fretta. Il resto diventa un ticket o un grafico su una dashboard. Meno chiamate, e ognuna vale la pena di alzarsi.
Prepariamo la giornata storta. Passiamo in rassegna i guasti possibili con il tuo team: una zona che cade, un disco pieno, un deploy sbagliato, un certificato scaduto, una dipendenza che invece di rompersi rallenta. Per ognuno c’è un modo per accorgersene, un runbook e, dove si può, un ripristino automatico. Quelli più rischiosi li proviamo apposta.
Gestiamo bene gli incidenti, e impariamo da ognuno. Ruoli chiari durante l’incidente, aggiornamenti di stato a cadenza fissa e, dopo, una breve analisi senza colpevoli che si chiude con responsabili e scadenze. Non un documento che nessuno legge.
Come lavoriamo di solito
Quasi sempre si parte dall’audit di production readiness di due settimane. Leggiamo l’architettura, le dashboard, lo storico degli alert e gli ultimi report sugli incidenti, e passiamo del tempo con chi fa on-call. L’audit si chiude con un elenco di interventi ordinati per rischio.
Da lì, alcuni team fanno gli interventi da soli, con qualche ora di consulenza al mese. Altri ci chiedono di fare insieme il primo giro, di solito dalle quattro alle otto settimane, e poi passiamo la mano quando il team è a suo agio nel gestire tutto.
Fa per te se
- Stai per andare live, o per firmare con un cliente che chiede uno SLA.
- Hai appena avuto un incidente che non vuoi rivivere.
- Il team riceve così tanti alert che ha smesso di leggerli.
- Sei cresciuto oltre il punto in cui una sola persona sa come funziona tutto.