Observar e responder — Operação
O coração da trilha. Um sistema em produção é uma caixa que você não vê por dentro — até instrumentá-la. E mesmo bem instrumentado, ele vai quebrar: a questão não é se, é quando, e o que você faz nos minutos seguintes. Este sub-galho (fase Magus) é reliability engineering de verdade: como instrumentar para responder perguntas que você não antecipou, como transformar confiabilidade num número gerenciável (SLO e error budget), como alertar sem enlouquecer o time de plantão, como conduzir um incidente ao vivo, como aprender com a falha sem caçar culpados, e como investigar sob pressão — ou provocar falhas de propósito antes que elas provoquem você.
Notas
- 01 - Observabilidade como prática
- 02 - SLI, SLO e error budgets
- 03 - Alerting que não gera fadiga
- 04 - Incident response e on-call
- 05 - Postmortems e cultura blameless
- 06 - Debugging de produção e chaos engineering
Veja também
- Operação — o galho-pai
- Rodar em produção — o sistema que esta seção observa
- Anatomia de um incidente de produção — o capstone que costura tudo