Fiabilidad y continuidad del negocio
Mantén las cargas de trabajo funcionando cuando la demanda se dispara o un componente falla: balanceo de carga y health checks, Auto Scaling, caché, escalado de bases de datos, tolerancia a fallos Multi-AZ, respaldos automatizados y las cuatro estrategias de recuperación ante desastres, desde backup y restore hasta activo/activo.
Una instancia se cae a las 02:00. Un lanzamiento triplica el tráfico en diez minutos. Que alguien fuera de operaciones lo note depende de decisiones tomadas mucho antes del incidente: cuántas zonas de disponibilidad cubre el sistema, si un health check saca de rotación al target que falla, si la capacidad crece sin intervención humana y qué tan rápido restauras los datos después de que alguien borró la tabla equivocada.
Este dominio pesa 22% del SOA-C03 y se apoya directamente en el primero. Una política de escalado es una alarma de CloudWatch con una acción conectada, y un failover es un health check leyendo una métrica. Aquí conviertes esa telemetría en disponibilidad.
Qué cubre este dominio
- Elastic Load Balancing con ALB, NLB y Gateway Load Balancer, health checks de target groups y targets que quedan unhealthy
- Health checks de Route 53, failover de DNS y zonal shift con Application Recovery Controller
- Auto Scaling groups de EC2, las políticas target tracking, step, scheduled y predictive, lifecycle hooks e instance refresh
- Escalado de contenedores y serverless: auto scaling de servicios ECS, EKS y concurrencia de Lambda
- Caché con CloudFront y ElastiCache, y escalado relacional con réplicas de lectura y Aurora Serverless v2
- Modos de capacidad de DynamoDB, auto scaling de tablas y DAX
- Tolerancia a fallos Multi-AZ, AWS Backup y snapshots, restauración point-in-time, y versionado y replicación en S3
- Las cuatro estrategias de recuperación ante desastres y los objetivos de RTO y RPO que deciden entre ellas
Por qué importa
Las preguntas de este dominio casi nunca te piden definir Multi-AZ. Te dan una restricción (un RPO de 5 minutos, un presupuesto que descarta una segunda flota encendida, sesiones que se rompen cuando las instancias terminan) y preguntan qué mecanismo la cumple. Responder exige saber cuánto cuesta cada opción en dinero, tiempo de recuperación y trabajo operativo, no solo qué hace.
Ese mismo razonamiento aparece en cada guardia. Si distingues un health check fallido de una política de escalado que nunca disparó, pasas el incidente resolviendo el problema en vez de descubriendo el diseño.
