Tema

Remediación basada en eventos

Buses, reglas y pipes de EventBridge, runbooks de Systems Manager Automation y los patrones que corrigen incidentes sin intervención humana.

El tema anterior terminó donde una alarma se queda sin margen: una reparación que necesita varios pasos ordenados, una decisión, o un recurso que las dimensiones de la alarma no nombran. Este tema arranca ahí. Cubre cómo algo que pasó se convierte en un evento, cómo ese evento llega al consumidor correcto, y cómo se escribe la reparación para que corra sola a las 03:00 sin empeorar el incidente.

Qué cubre este tema

  • La diferencia entre una métrica y un evento, y qué problemas de detección necesita cada uno
  • El sobre del evento de EventBridge, los buses default y personalizados, y las reglas
  • El matching de patrones en detalle: semántica de subconjunto, arrays como OR, matching exacto de caracteres y los operadores de comparación
  • Permisos de los targets, el input transformer, las reglas programadas y EventBridge Scheduler
  • EventBridge Pipes: las etapas de fuente, filtro, enriquecimiento y target, y cuándo un pipe gana sobre un bus
  • Batching, concurrencia, fallas parciales de lote y logs de pipes
  • Diagnóstico de entregas: políticas de reintento, dead-letter queues, las métricas de AWS/Events, ciclos infinitos, y archive y replay
  • Runbooks de Systems Manager Automation: el vocabulario de acciones, las propiedades de paso, la cadena de dos roles, las aprobaciones y el control de ritmo
  • Las cuatro fuentes de detección y los patrones de remediación construidos sobre ellas, incluidas las acciones de remediación de AWS Config
  • Las barandas que necesita toda reparación automática, y dónde encajan AWS DevOps Agent y Kiro en un ciclo de incidentes

Por qué importa

La tarea 1.2 de la guía del examen SOA-C03 te pide enrutar, enriquecer y entregar eventos con EventBridge, diagnosticar reglas de bus y ejecutar runbooks de Automation predefinidos y personalizados. Son tres habilidades distintas, y las preguntas casi nunca las prueban por separado: un escenario te da síntomas y pregunta qué revisar, o te da una reparación y pregunta qué mecanismo la ejecuta.

Esta misma maquinaria reaparece en el resto del curso. La respuesta automática ante hallazgos de cumplimiento, en el dominio de seguridad, es una regla de EventBridge con otra fuente de eventos. El parcheo de flotas del dominio de despliegue es un runbook con controles de ritmo. Aprende bien acá el enrutamiento y el modelo de runbooks y los dominios que siguen se vuelven aplicaciones de esto en vez de material nuevo.

Lecciones de este tema

  1. 1Fundamentos de EventBridgeGratis
  2. 2EventBridge Pipes y diagnóstico de entregas
  3. 3Runbooks de Systems Manager Automation
  4. 4Patrones de remediación automatizada