Disponibilité et résilience
Pourquoi chaque dépendance finit par tomber, et comment continuer à servir vos utilisateurs malgré tout. Vous quantifiez la disponibilité avec des SLO et des budgets d'erreur, concevez redondance et basculement, et appliquez les patterns de résilience comme le circuit breaker, appuyés par l'observabilité.
Ce domaine part d'un fait inconfortable : à grande échelle, quelque chose est toujours en panne. Vous apprenez à mesurer la disponibilité comme le font les exploitants, à fixer des SLO et à dépenser les budgets d'erreur délibérément, et à construire une redondance qui survit à la perte d'une zone. Les sujets de résilience durcissent ensuite chaque chemin d'appel avec timeouts, retries, circuit breakers et dégradation contrôlée, le tout rendu visible par l'observabilité.
