Evaluación de modelos fundacionales
Demostrar que un FM funciona: enfoques de evaluación, métricas como ROUGE y BLEU, evaluación de aplicaciones RAG y de agentes, y alineación con el negocio.
Ya elegiste un modelo, lo anclaste en tus datos, moldeaste su comportamiento con prompts y tal vez le hiciste ajuste fino. Nada de eso te dice si el resultado es bueno. Este tema cierra el dominio más pesado del examen con la pregunta que decide si algo de lo que construiste debería lanzarse: ¿cómo lo sabes, con evidencia en vez de una demo?
La respuesta tiene capas. Los puntajes te dicen si el texto se acerca a algo aceptable. Los jueces y los revisores humanos te dicen si es realmente útil. Las métricas por etapa te dicen qué parte de tu pipeline de RAG o de agentes se rompió. Y las señales de negocio te dicen si algo de eso cambió el trabajo que hace la gente.
Qué cubre este tema
- los tres enfoques de evaluación: puntuación automática contra un dataset, un LLM que actúa como juez y revisores humanos, con los tipos de tarea, los datasets integrados y los mecanismos de calificación de cada uno
- datasets de benchmark como MMLU y HELM, y por qué un puesto en un leaderboard no es un veredicto sobre tu caso de uso
- ROUGE, BLEU y BERTScore trabajadas con oraciones reales y números reales, más la métrica que AWS calcula para cada tipo de tarea de evaluación
- evaluación de RAG en Amazon Bedrock: métricas de retrieve only, métricas de retrieve and generate, y la frontera entre faithfulness y correctness
- evaluación de agentes con AgentCore Evaluations, incluidos goal success rate y la precisión de selección de herramientas y de parámetros
- juzgar si un modelo cumple un objetivo de negocio a través de productividad, engagement de usuarios y task engineering, más umbrales de aceptación, datasets de ground truth, retroalimentación de usuarios y drift
Por qué importa
La evaluación es donde las preguntas del examen dejan de ser definiciones. Te van a dar un escenario sin ground truth, o un sistema que puntúa bien y se porta mal, y te van a preguntar qué enfoque o qué métrica encaja. Acertar depende de saber qué puede probar cada medición por construcción.
La misma habilidad decide resultados reales. Los equipos que no pueden medir su aplicación de IA generativa no pueden defenderla, mejorarla ni cambiar el modelo de abajo con seguridad. Todo en este tema existe para reemplazar el "se veía bien cuando lo probé" por algo que sobreviva a una revisión.
