AWS Certified AI Practitioner
Cómo se entrenan los modelos fundacionales
De dónde sale el conocimiento de un modelo base: pre-entrenamiento autosupervisado sobre texto masivo, luego ajuste por instrucciones y RLHF que convierten un predictor de texto en un asistente útil.
- Explicar cómo el pre-entrenamiento usa predicción autosupervisada del siguiente token sobre texto grande sin etiquetar
- Distinguir las tres etapas que producen un modelo fundacional usable: pre-entrenamiento, ajuste fino y alineación
- Describir qué aporta RLHF que los ejemplos etiquetados por sí solos no pueden dar
- Explicar por qué personalizas un modelo pre-entrenado en lugar de entrenar uno desde cero
Ya sabes ubicar el ajuste fino en la escalera de personalización: está por encima de la ingeniería de prompts y de RAG, cambia los pesos del modelo y lo eliges cuando el comportamiento tiene que ser consistente. Pero para entender qué cambia realmente el ajuste fino, primero necesitas saber qué puso ya el pre-entrenamiento dentro del modelo. Un modelo base como Amazon Titan o Anthropic Claude llega sabiendo una cantidad asombrosa antes de que le mandes una sola petición. ¿De dónde salió ese conocimiento, y por qué le cuesta tanto a un proveedor fabricar uno?
La respuesta es una tubería de tres etapas. Saber qué hace cada etapa te dice qué partes del modelo puedes influir de verdad, qué partes heredas y en qué punto exacto se enchufa tu propia personalización. Ese es un objetivo nombrado del examen, y también es la diferencia entre elegir el método de personalización correcto y malgastar un presupuesto de entrenamiento en el equivocado.
Pre-entrenamiento: aprender el lenguaje a partir de texto crudo
El pre-entrenamiento es la etapa que le da a un modelo fundacional su conocimiento crudo, y funciona con una sola tarea repetida: predecir el siguiente token. Dale al modelo la secuencia "La capital de Francia es" y aprende a predecir "París". Dale "def add(a, b): return" y aprende a predecir "a + b". El modelo recorre el texto token por token, adivina cada siguiente token y ajusta sus miles de millones de parámetros cada vez que se equivoca.
Aquí está la parte que lo vuelve escalable. Nadie etiqueta estos datos. La respuesta correcta para cada posición es simplemente el token que de verdad viene después en el texto, así que el texto se supervisa a sí mismo. Eso es lo que significa autosupervisado, y es la razón por la que el pre-entrenamiento puede consumir billones de tokens de libros, sitios web, código y artículos sin un ejército de anotadores. El modelo no memoriza una tabla de consulta; comprime en sus pesos los patrones estadísticos del lenguaje, los hechos y el razonamiento.
Esto es un quiebre fuerte con el aprendizaje supervisado que viste antes en el curso, donde cada ejemplo de entrenamiento venía con una etiqueta puesta por un humano. En el pre-entrenamiento no hay etiquetas separadas. La siguiente palabra es la etiqueta. Esa única decisión de diseño es lo que dejó que los modelos fundacionales crecieran al tamaño que tienen.
Un detalle mecánico importa para entender por qué esto es siquiera factible: la arquitectura transformer procesa una secuencia completa en paralelo en vez de una palabra a la vez, lo que deja a los proveedores entrenar sobre flotas grandes de GPUs. Aun así, una corrida completa de pre-entrenamiento tarda semanas y cuesta una fortuna en cómputo, que es la razón por la que casi nadie lo hace por su cuenta.
Por qué el pre-entrenamiento solo no alcanza
Un modelo recién salido del pre-entrenamiento se llama modelo base, y tiene una personalidad peculiar: predice texto plausible, pero no sabe que se supone que debe ser útil. Pregúntale a un modelo base crudo "¿Cuál es la capital de Francia?" y podría continuar con más preguntas de trivia, porque en sus datos de entrenamiento una pregunta suele venir seguida de más preguntas. Tiene el conocimiento, pero no los modales.
Dos etapas más arreglan esto. Usan muchísimos menos datos que el pre-entrenamiento, y moldean el comportamiento en lugar de verter conocimiento.
Ajuste fino y ajuste por instrucciones: enseñarle a seguir instrucciones
La siguiente etapa entrena el modelo base sobre un conjunto mucho más pequeño de ejemplos etiquetados, cada uno emparejando una instrucción con una buena respuesta. Al mostrarle miles de ejemplos como "Resume este párrafo" seguidos de un resumen limpio, el modelo aprende el hábito general de hacer lo que se le pide. Como los ejemplos son instrucciones y sus respuestas, esto se llama a menudo ajuste por instrucciones, y es una forma de ajuste fino supervisado.
Este es el mismo mecanismo que usarás para personalizar un modelo más adelante en este tema. El proveedor lo aplica primero, de forma amplia, para hacer un asistente general; tú puedes aplicarlo de nuevo, de forma acotada, para especializar ese asistente en tu tarea. La herramienta es idéntica, solo cambian los datos y el objetivo.
Alineación con retroalimentación humana (RLHF)
Hay una cosa que los ejemplos etiquetados manejan mal: la calidad subjetiva. Qué cuenta como una respuesta útil, honesta y prudente en su justa medida es difícil de escribir como una única respuesta correcta. Lo reconoces cuando lo ves, pero no lo puedes etiquetar con facilidad.
El aprendizaje por refuerzo con retroalimentación humana (RLHF) resuelve esto aprendiendo de comparaciones en vez de respuestas fijas. El modelo produce varias respuestas al mismo prompt, los humanos rankean cuál prefieren, y esos rankings entrenan un modelo de recompensa separado que predice cómo calificaría un humano cualquier respuesta. Después se ajusta el modelo principal para puntuar bien contra ese modelo de recompensa. El resultado es el comportamiento pulido y alineado que esperas de un asistente en producción. Fíjate en lo que RLHF hace y no hace: moldea el tono y la utilidad, no enseña hechos nuevos.
Las tres etapas juntas
| Etapa | Datos | Quién la ejecuta | Qué produce |
|---|---|---|---|
| Pre-entrenamiento | Billones de tokens, sin etiquetar | Proveedor del modelo | Un modelo base que predice texto |
| Ajuste fino / ajuste por instrucciones | Pares etiquetados de instrucción y respuesta | Proveedor (y tú, después) | Un modelo que sigue instrucciones |
| Alineación (RLHF) | Rankings de preferencia humana | Proveedor del modelo | Un asistente útil y alineado |
Lee la tabla de arriba abajo y observa cómo cambian los datos. Empiezan enormes y sin etiquetar, se reducen a pares etiquetados, y luego se reducen de nuevo a juicios humanos. El esfuerzo se mueve de la escala cruda hacia la curación cuidadosa.
Qué significa esto para ti
Casi nunca ejecutas la etapa 1. Pre-entrenar un modelo fundacional exige datos y cómputo a una escala que le cuesta sumas enormes al proveedor, y pagar eso desde cero tiraría a la basura toda la ventaja de los modelos fundacionales, que es que alguien ya lo hizo. Esta es la misma razón por la que el curso contrastó antes el ML tradicional, donde entrenas tu propio modelo, con los modelos fundacionales, donde partes de uno pre-entrenado.
Donde entras tú es en la personalización, y mapea limpio sobre las etapas que acabas de ver. El pre-entrenamiento continuo extiende la etapa 1 con tu propio texto de dominio. El ajuste fino repite la etapa 2 con tus propios ejemplos etiquetados. La próxima lección desarma estos métodos y muestra cuándo encaja cada uno.
Consejos para el examen
- El pre-entrenamiento es autosupervisado, usa texto sin etiquetar, funciona por predicción del siguiente token, corre a escala masiva y lo hace el proveedor. Esas palabras clave viajan juntas.
- "Datos sin etiquetar" más "aprende lenguaje y patrones generales" apunta al pre-entrenamiento. "Ejemplos etiquetados" más "una tarea o comportamiento específico" apunta al ajuste fino.
- RLHF alinea el modelo con las preferencias humanas mediante un modelo de recompensa. Si una pregunta dice que una técnica agrega conocimiento factual nuevo, RLHF es la respuesta equivocada.
- Los modelos fundacionales existen para que no pre-entrenes desde cero. Una opción que sugiera entrenar un modelo grande desde cero para un caso de negocio normal casi siempre es el distractor.
- El modelo base que llamas en Bedrock ya es la salida de las tres etapas, lo personalices después o no.
El modelo base en tu consola de Bedrock es el producto terminado de tres etapas que nunca pagaste: pre-entrenamiento masivo sin etiquetar, ajuste por instrucciones etiquetado y alineación basada en preferencias. Guarda ese mapa en la cabeza, porque tu propia personalización no es una cosa nueva y misteriosa. Es una de esas mismas dos etapas de ajuste, corrida de nuevo sobre tus datos, que es justo lo que desglosa la próxima lección.
