Operação (DevOps/SRE) — aplicar tudo junto em produção

O par do System Design: se aquela trilha ensina a desenhar o sistema no whiteboard, esta ensina a mantê-lo vivo em produção. É escrita para quem já conhece as peças — os containers, o Kubernetes, o CI/CD, a observabilidade, o backend — e quer saber como operá-las juntas, com as decisões e os trade-offs que só aparecem quando o serviço está no ar e alguém precisa acordar às 3h da manhã para consertá-lo.

Onde isto se encaixa

As ferramentas vivem na estante Infraestrutura (Docker, Kubernetes, CI/CD, Observabilidade, Nginx — o “o que é” e a sintaxe). Aqui é a prática de operar: como combinar essas ferramentas, quando usar cada estratégia, e o que fazer quando tudo dá errado. A ótica de aplicação-JVM (JVM em container, contrato K8s da app Spring) mora no galho Cloud-native do Java; aqui a visão é agnóstica de linguagem. Cloud gerenciada (AWS/GCP) é cobertura à parte.

Sub-galhos

1 · O ofício de operar (Iniciado→Adepto)

O que muda quando o código vira um serviço que alguém precisa manter vivo.

2 · Entrega e release (Adepto)

Levar código a produção com segurança e velocidade: pipelines, deploy strategies, rollback, migrations.

3 · Rodar em produção (Adepto→Magus)

Manter o sistema no ar, escalando e sem derrubar ninguém: containers, Kubernetes, zero-downtime, capacidade.

4 · Observar e responder (Magus)

Reliability engineering: enxergar o sistema, medir confiabilidade e reagir quando ele quebra.

★ Capstone (Magus)

Recursos

  • Site Reliability Engineering & The SRE Workbook — Google (sre.google/books)
  • The DevOps Handbook — Gene Kim et al.
  • Accelerate — Forsgren, Humble, Kim (as 4 métricas DORA)
  • Release It! — Michael Nygard (padrões de estabilidade)
  • AWS Builders’ Library

Veja também