Observar e responder — Operação

O coração da trilha. Um sistema em produção é uma caixa que você não vê por dentro — até instrumentá-la. E mesmo bem instrumentado, ele vai quebrar: a questão não é se, é quando, e o que você faz nos minutos seguintes. Este sub-galho (fase Magus) é reliability engineering de verdade: como instrumentar para responder perguntas que você não antecipou, como transformar confiabilidade num número gerenciável (SLO e error budget), como alertar sem enlouquecer o time de plantão, como conduzir um incidente ao vivo, como aprender com a falha sem caçar culpados, e como investigar sob pressão — ou provocar falhas de propósito antes que elas provoquem você.

Notas

  1. 01 - Observabilidade como prática
  2. 02 - SLI, SLO e error budgets
  3. 03 - Alerting que não gera fadiga
  4. 04 - Incident response e on-call
  5. 05 - Postmortems e cultura blameless
  6. 06 - Debugging de produção e chaos engineering

Veja também