Monitoramento, registro, análise, remediação e otimização de desempenho
Como ver o que suas cargas de trabalho estão fazendo e agir sobre isso: métricas, logs, alarmes e dashboards do CloudWatch, remediação orientada a eventos com EventBridge e Systems Manager, e ajuste de desempenho para computação, armazenamento e bancos de dados. Um dos domínios de maior peso na prova e o núcleo do dia a dia de CloudOps.
Algo está errado com uma carga de trabalho e ninguém sabe dizer o quê. Fechar a distância entre "o app está lento" e "o volume EBS ficou sem créditos de burst às 09:14" é o assunto deste domínio. Ele cobre o que a AWS mede por você, o que você precisa instrumentar por conta própria, como transformar essa telemetria em alertas e correções automáticas, e como ler os números na hora de ajustar desempenho.
Este domínio vale 22% do SOA-C03 e abre o curso porque todo o resto lê dele. Uma política de escalabilidade precisa de uma métrica. Um runbook de remediação precisa de um evento. Um ajuste de desempenho precisa de um número que prove que funcionou.
O que este domínio cobre
- Métricas e logs do CloudWatch, consultas no Logs Insights, o agente do CloudWatch e o CloudTrail para o histórico no nível da API
- Container Insights, Prometheus e Grafana gerenciados, e monitoramento de cargas serverless e de IA
- Alarmes do CloudWatch, alarmes compostos, ações de alarme, alertas com SNS e dashboards
- Remediação orientada a eventos com regras e Pipes do EventBridge, runbooks do Systems Manager Automation e os padrões comuns de correção automática
- Ajuste de computação e armazenamento: right-sizing com o Compute Optimizer, placement groups, tipos de volume EBS e IOPS, desempenho de requisições e transferência no S3, EFS e FSx
- RDS Performance Insights, Enhanced Monitoring, RDS Proxy e ajuste no nível das conexões
Por que isso importa
As questões deste domínio são diagnósticas. Você recebe sintomas (um alarme travado em INSUFFICIENT_DATA, uma função Lambda cujos logs nunca aparecem, uma instância EC2 sem métrica de memória no CloudWatch) e precisa dizer o que checar. Reconhecer nomes de serviço não resolve. Você precisa saber quais métricas a AWS publica por padrão, quais exigem o agente, onde cada log stream vai parar e o que um alarme realmente avalia dentro do período dele.
Esse mesmo conhecimento sustenta o resto do curso. O Auto Scaling do próximo domínio é um alarme do CloudWatch com uma política de escalabilidade ligada nele. A resposta automática a achados de conformidade, no domínio de segurança, é uma regra do EventBridge com outra fonte de eventos. Aprenda bem a camada de telemetria aqui e você passa os quatro domínios restantes aplicando esse conhecimento, em vez de reaprendê-lo.
