Monitoreo, registro, análisis, remediación y optimización del rendimiento
Cómo ver lo que hacen tus cargas de trabajo y actuar en consecuencia: métricas, logs, alarmas y dashboards de CloudWatch, remediación basada en eventos con EventBridge y Systems Manager, y ajuste de rendimiento para cómputo, almacenamiento y bases de datos. Es uno de los dominios con más peso en el examen y el núcleo del día a día de un ingeniero CloudOps.
Algo anda mal con una carga de trabajo y nadie sabe decir qué. Cerrar la distancia entre "la app se siente lenta" y "el volumen EBS se quedó sin créditos de ráfaga a las 09:14" es de lo que trata este dominio. Cubre qué mide AWS por ti, qué tienes que instrumentar tú, cómo convertir esa telemetría en alertas y correcciones automáticas, y cómo leerla cuando ajustas el rendimiento.
Este dominio pesa 22% del SOA-C03 y va primero en el curso porque todo lo que sigue lee de él. Una política de escalado necesita una métrica. Un runbook de remediación necesita un evento. Un ajuste de rendimiento necesita un número que pruebe que funcionó.
Qué cubre este dominio
- Métricas y logs de CloudWatch, consultas de Logs Insights, el agente de CloudWatch y CloudTrail para el historial a nivel de API
- Container Insights, Prometheus y Grafana administrados, y monitoreo de cargas serverless y de IA
- Alarmas de CloudWatch, alarmas compuestas, acciones de alarma, alertas con SNS y dashboards
- Remediación basada en eventos con reglas y Pipes de EventBridge, runbooks de Systems Manager Automation y los patrones comunes de auto-remediación
- Ajuste de cómputo y almacenamiento: right-sizing con Compute Optimizer, placement groups, tipos de volumen EBS e IOPS, rendimiento de solicitudes y transferencia en S3, EFS y FSx
- RDS Performance Insights, Enhanced Monitoring, RDS Proxy y ajuste a nivel de conexiones
Por qué importa
Las preguntas de este dominio son diagnósticas. Te dan síntomas (una alarma atascada en INSUFFICIENT_DATA, una función Lambda cuyos logs nunca aparecen, una instancia EC2 sin métrica de memoria en CloudWatch) y te preguntan qué revisar. Reconocer nombres de servicios no alcanza. Necesitas saber qué métricas publica AWS de forma predeterminada, cuáles requieren el agente, dónde aterriza cada log stream y qué evalúa realmente una alarma durante su período.
Ese mismo conocimiento sostiene el resto del curso. El Auto Scaling del siguiente dominio es una alarma de CloudWatch con una política de escalado conectada. La respuesta automática ante hallazgos de cumplimiento, en el dominio de seguridad, es una regla de EventBridge con otra fuente de eventos. Aprende bien la capa de telemetría aquí y pasarás los cuatro dominios restantes aplicándola en vez de volver a aprenderla.
