Confiabilidade e Dados para Produção

Definition

Confiabilidade e dados reúne 2 rule-sets para sistemas que precisam sobreviver à produção: Designing Data-Intensive Applications (Kleppmann, 205 regras full, mini 37) e Release It! (Nygard, 204 regras full, mini 30). No agent-rules-books viram mini focados em confiabilidade, escalabilidade, consistência e sobrevivência a falhas.

Key Points

  • DDIA (mini 37 regras): reliability, scalability, consistência, replicação, particionamento, transações, streams, evolução de schema; pensado para quando ownership de dados, fluxos de evento e semântica de consistência importam.
  • Release It! (mini 30 regras): falhas reais, sobrecarga, timeouts, retries, circuit breakers, bulkheads, backpressure, observabilidade (logs, métricas, traces), deployment seguro; essencial para serviços, APIs, filas e integrações críticas.
  • Quando usar: quando o produto deixa de ser “MVP que roda local” e vira serviço com usuários, dinheiro ou dados críticos — exatamente o momento em que system-design categorias Cloud/Distribuído, Caching e Segurança ganham peso.
  • Entrega: regras guiam o agente a colocar timeouts explícitos, retries com jitter, degradação graciosa e dashboard antes que o founder peça “torna o sistema estável”.

Checklist de produção para cobrar do agente

  • Timeout e retry definidos (com backoff/jitter, não retry infinito)?
  • Circuit breaker / bulkhead onde há chamada externa?
  • Fila/stream com backpressure e dead-letter?
  • Observabilidade: logs estruturados, métricas e health-check?
  • Schema com compatibilidade (forward/backward) e migração versionada?
  • Deploy com rollback e feature-flag onde o risco é alto?

Implications

Sem este cluster, o agente vibe-coded entrega “funciona no happy path” e quebra no primeiro pico ou falha de rede. Com ele, o founder especifica comportamento sob falha — a diferença entre demo e produto que aguenta produção.

Sources