Disponibilidade e resiliência
Por que toda dependência falha uma hora, e como continuar atendendo usuários mesmo assim. Você quantifica disponibilidade com SLOs e orçamentos de erro, projeta redundância e failover, e aplica padrões de resiliência como circuit breakers, com observabilidade por trás.
Este domínio parte de um fato desconfortável: em grande escala, sempre tem algo falhando. Você aprende a medir disponibilidade como os operadores medem, a definir SLOs e gastar orçamentos de erro de propósito, e a construir redundância que sobrevive à perda de uma zona. Os tópicos de resiliência depois endurecem cada caminho de chamada com timeouts, retries, circuit breakers e degradação controlada, tudo visível pela observabilidade.
