Tópico

Métricas e logs no CloudWatch

Como o CloudWatch coleta métricas e logs em EC2, contêineres, serverless e cargas de IA, e onde o CloudTrail entra.

Antes de alarmar, escalar ou ajustar qualquer coisa, você precisa dos números e do texto que descrevem o que está acontecendo. Este tópico monta a camada de coleta do curso inteiro: o que a AWS mede por você, o que só existe se você instrumentar, e onde cada sinal aterrissa. Os tópicos seguintes assumem que você sabe encontrar e ler esses sinais.

O que este tópico cobre

  • Como o CloudWatch identifica uma métrica por namespace, nome e dimensões, e como resolução, retenção e estatísticas decorrem da forma como ela foi publicada
  • Log groups, log streams e retenção, mais as três saídas de um log group: metric filters, subscription filters e consultas do Logs Insights
  • Por que memória e uso de disco não aparecem sozinhos em EC2, e como instalar, configurar e diagnosticar o agente do CloudWatch numa frota com Systems Manager e Parameter Store
  • O CloudTrail como registro de quem chamou qual API: event history contra trails, os quatro tipos de evento, organization trails, CloudTrail Lake e o caminho até um alarme sobre atividade na conta
  • Telemetria de contêineres com Container Insights no ECS e no EKS, e quando usar Amazon Managed Service for Prometheus com Amazon Managed Grafana
  • Monitoramento de Lambda, API Gateway e Amazon Bedrock, incluindo a diferença entre throttle e erro e a atribuição de tokens por chamador

Por que isso importa

As questões do SOA-C03 neste tópico são diagnósticas, não de memorização. Elas descrevem um sintoma (um alarme travado em INSUFFICIENT_DATA, uma instância sem métrica de memória, uma função Lambda cujos logs nunca aparecem, uma taxa de erro verde enquanto os usuários recebem 429) e pedem a causa. Cada um desses sintomas vem de uma fronteira específica: o período do alarme contra a resolução da métrica, o hypervisor contra o sistema operacional convidado, a execution role contra as permissões de log, o throttle contra o erro.

No trabalho, é a mesma coisa. Você não pode consertar o que não consegue ver, e boa parte do que precisa ver vem desligado por padrão.

Lições deste tópico

  1. 1Fundamentos das métricas do CloudWatchGratuito
  2. 2CloudWatch Logs e Logs Insights
  3. 3Implantar o agente do CloudWatch
  4. 4CloudTrail para operações
  5. 5Container Insights, Prometheus e Grafana
  6. 6Monitorar cargas serverless e de IA