Piattaforma e affidabilità

SRE e affidabilità in produzione

Hai un servizio che sta per andare in produzione, o che ci è già, e qualcuno deve rispondere alle domande scomode. Qual è l'error budget? Cosa sveglia qualcuno alle 3 di notte? Cosa succede se cade una zona? Ti aiutiamo a rispondere prima che lo faccia un cliente.

Cosa facciamo

Definiamo cosa vuol dire “funziona”. Scegliamo i pochi percorsi utente che contano davvero, come la registrazione, il pagamento o il caricamento della dashboard. Poi fissiamo degli obiettivi di servizio (SLO): quanto veloce, quante volte va a buon fine, misurato dove l’utente lo percepisce. Diventano i numeri su cui il team discute, invece delle opinioni.

Diamo un senso agli alert. Teniamo solo gli alert che segnalano un impatto sugli utenti o un error budget che si consuma troppo in fretta. Il resto diventa un ticket o un grafico su una dashboard. Meno chiamate, e ognuna vale la pena di alzarsi.

Prepariamo la giornata storta. Passiamo in rassegna i guasti possibili con il tuo team: una zona che cade, un disco pieno, un deploy sbagliato, un certificato scaduto, una dipendenza che invece di rompersi rallenta. Per ognuno c’è un modo per accorgersene, un runbook e, dove si può, un ripristino automatico. Quelli più rischiosi li proviamo apposta.

Gestiamo bene gli incidenti, e impariamo da ognuno. Ruoli chiari durante l’incidente, aggiornamenti di stato a cadenza fissa e, dopo, una breve analisi senza colpevoli che si chiude con responsabili e scadenze. Non un documento che nessuno legge.

Come lavoriamo di solito

Quasi sempre si parte dall’audit di production readiness di due settimane. Leggiamo l’architettura, le dashboard, lo storico degli alert e gli ultimi report sugli incidenti, e passiamo del tempo con chi fa on-call. L’audit si chiude con un elenco di interventi ordinati per rischio.

Da lì, alcuni team fanno gli interventi da soli, con qualche ora di consulenza al mese. Altri ci chiedono di fare insieme il primo giro, di solito dalle quattro alle otto settimane, e poi passiamo la mano quando il team è a suo agio nel gestire tutto.

Fa per te se

  • Stai per andare live, o per firmare con un cliente che chiede uno SLA.
  • Hai appena avuto un incidente che non vuoi rivivere.
  • Il team riceve così tanti alert che ha smesso di leggerli.
  • Sei cresciuto oltre il punto in cui una sola persona sa come funziona tutto.

Domande frequenti

Che differenza c'è tra SRE e DevOps?
DevOps è un modo di lavorare: sviluppo e operations condividono la responsabilità del software in produzione. SRE è un modo concreto di farlo, con obiettivi misurabili (SLO), un error budget che decide quando rallentare e lavoro di ingegneria per eliminare il lavoro manuale ripetitivo. Usiamo le pratiche SRE perché ti danno numeri su cui discutere, invece di opinioni.
Serve un team SRE dedicato?
Di solito no, sotto i 50-80 sviluppatori. Alla maggior parte dei team servono SLO chiari, un alerting sensato e un on-call condiviso, gestiti dai team di prodotto stessi. Noi lo impostiamo e formiamo le persone che lo porteranno avanti.
Con quali strumenti di monitoraggio lavorate?
Prometheus, Grafana, Google Cloud Monitoring, CloudWatch, Datadog, OpenTelemetry e quasi tutti i soliti noti. Preferiamo migliorare quello che usi già piuttosto che migrarti su qualcosa di nuovo.
Quanto dura un audit di production readiness?
Due settimane per un prodotto tipico con pochi servizi. Ricevi un report scritto con un elenco di interventi ordinati per rischio, e resta tuo che poi gli interventi li facciamo noi o no.

Raccontaci cosa non funziona.

Bastano poche righe. Rispondiamo entro un giorno lavorativo e la prima call è gratuita.