Solución de problemas de red
Un método sistemático para problemas de conectividad de VPC, análisis de logs de red, depuración de CloudFront, enlaces híbridos y monitoreo de red de CloudWatch.
Todos los otros temas de este dominio construyeron algo. Este lo desarma cuando deja de funcionar. Una conexión expira y tienes 4 sospechosos plausibles, un cache hit ratio se derrumba sin ningún despliegue, una VPN reporta available mientras nada la cruza. Lo que separa un arreglo de 20 minutos de una caída de 3 horas no es saber más servicios, es tener un orden de trabajo y saber qué fuente de evidencia puede ver de verdad el salto que sospechas.
Qué cubre este tema
- Un recorrido ordenado de origen a destino que encuentra el componente que bloquea en lugar de adivinar, más Reachability Analyzer y sus explanation codes
- Leer un registro de VPC flow log campo por campo, y el patrón ACCEPT y después REJECT que separa una denegación de security group de una de network ACL
- El tráfico que los VPC flow logs nunca capturan, y cuándo la respuesta son los Transit Gateway Flow Logs, los access logs de ELB, los logs de WAF o los query logs del Resolver
- Consultar logs a volumen con CloudWatch Logs Insights y con Amazon Athena
- Diagnóstico de CloudFront desde los response headers y los campos de tipo de resultado, las causas detrás de los 403, 502 y 504, y cómo encontrar la dimensión de la cache key que destroza tu hit ratio
- Enlaces híbridos diagnosticados de abajo hacia arriba: Fase 1 contra Fase 2 contra BGP en la VPN, y capa 1 contra capa 2 contra capa 3 en Direct Connect
- Las fallas de ruteo y de DNS que dejan un enlace perfectamente sano sin llevar tráfico
- Internet Monitor, Network Flow Monitor y Network Synthetic Monitor, y las métricas por recurso que atrapan fallas que nadie reportó
Por qué importa
La tarea 5.3 del examen es diagnóstico puro, y sus preguntas se construyen rompiendo exactamente una cosa dentro de una arquitectura por lo demás correcta. Los candidatos que sufren son los que conocen cada servicio por separado y no tienen método para reducir 4 sospechosos a uno. Los que aprueban leen el síntoma primero: un timeout y un connection refused apuntan a capas distintas, un registro REJECT solo y un par ACCEPT más REJECT apuntan a firewalls distintos, un 502 y un 504 apuntan a mitades distintas de la conexión con el origin.
La misma disciplina es la que marca la diferencia estando de guardia. Nombrar el salto que sospechas antes de abrir una consola te elige la herramienta, y elegir bien es la mayor parte del trabajo.
