AWS Certified AI Practitioner

Modelos fundacionales y large language models

Entra en la arquitectura transformer detrás de los modelos fundacionales: cómo el self-attention lee una secuencia completa de una sola vez, qué guardan realmente los parámetros y por qué un LLM es un tipo de modelo fundacional y no un sinónimo.

Principiante 18 minutos 4 Objetivos de aprendizaje
  1. Definir qué es un modelo fundacional y explicar qué lo hace adaptable a muchas tareas
  2. Explicar cómo la arquitectura transformer procesa una secuencia y por qué importa el self-attention
  3. Describir qué son los parámetros de un modelo y qué produce el pre-entrenamiento con datos sin etiquetar
  4. Distinguir un modelo fundacional de un large language model y de un modelo tradicional de una sola tarea

El Dominio 1 te dio una versión de una línea sobre los large language models: predicen el siguiente token, y lo vuelven a hacer. Es cierto, y no alcanza. No explica cómo un modelo que lee "el trofeo no cabía en la maleta porque era muy grande" deduce que "era" se refiere al trofeo. Nada cerca de esa palabra lo dice. La respuesta está nueve palabras atrás, y el modelo tiene que alcanzarla.

Cómo un modelo alcanza algo lejano dentro de una frase es el mecanismo que hizo funcionar a la IA generativa moderna. Esta lección abre la arquitectura y luego la usa para separar dos términos que el examen disfruta mezclar: modelo fundacional y large language model.

Qué es realmente un modelo fundacional

El glosario de Amazon Bedrock define un modelo fundacional como "un modelo de IA con una gran cantidad de parámetros y entrenado con una cantidad masiva de datos diversos. Un modelo fundacional puede generar una variedad de respuestas para un amplio rango de casos de uso. Los modelos fundacionales pueden generar texto o imágenes, y también convertir la entrada en embeddings".

Lee esa definición como tres afirmaciones apiladas. Escala: miles de millones de parámetros, no miles. Amplitud: datos diversos, no un conjunto curado para una tarea. Adaptabilidad: muchos casos de uso desde un solo modelo.

La tercera es la que cambió la forma de construir. Un modelo de ML tradicional es una herramienta de un solo propósito. Entrenas un clasificador de fraude con transacciones etiquetadas y detecta fraude. No puede resumir un contrato, y ningún prompt lo hará intentarlo. Un modelo fundacional invierte eso. Un mismo modelo resume, traduce, escribe código y responde preguntas, guiado por lo que escribes en vez de por un reentrenamiento.

La economía sale de la arquitectura. Pre-entrenar un modelo fundacional cuesta millones de dólares y meses de cómputo, algo que ningún equipo normal puede absorber. Pero ese costo lo paga una vez el proveedor del modelo y luego se reparte entre todos sus clientes y todas sus tareas. Por eso "elige un modelo y hazle prompt" reemplazó a "entrena un modelo por problema" como punto de partida, y por eso el examen dedica un dominio entero a modelos que tú no construiste.

El problema que resolvieron los transformers

Antes de 2017, los modelos de secuencia leían texto como quien lee un fax que va saliendo de la máquina: una palabra a la vez, de izquierda a derecha, cargando un resumen que se va acumulando. Eso es una red neuronal recurrente. AWS plantea el contraste sin rodeos: "las RNN procesan secuencias de datos un elemento a la vez", mientras que los transformers "procesan secuencias enteras de forma simultánea", lo que da "tiempos de entrenamiento mucho más rápidos y la capacidad de manejar secuencias mucho más largas que las RNN".

Leer palabra por palabra falla en dos frentes. Primero es lento, porque el paso 500 no puede empezar hasta que termine el 499, así que no puedes repartir el trabajo entre miles de GPUs. Segundo, y peor, el resumen acumulado se degrada. Para cuando la RNN llega a "era muy grande", el trofeo ya pasó por nueve rondas de compresión y casi no queda nada de él.

El transformer bota el resumen acumulado. Carga toda la secuencia de una vez y deja que cada token mire directamente a todos los demás. Nada tiene que sobrevivir una carrera de relevos.

Self-attention: decidir qué importa

El self-attention es el mecanismo que hace ese mirar. AWS lo describe como el mecanismo que "permite al modelo ver distintas partes de la secuencia todas a la vez y determinar qué partes son las más importantes".

Piensa en una reunión de proyecto donde todos se escuchan entre sí. Cuando el tema pasa a la fecha de despliegue, pones toda tu atención en el ingeniero de release, escuchas a medias al diseñador y desconectas del resto de la sala. No comprimes la reunión en un resumen para luego reaccionar al resumen. Reaccionas a las personas, pesando a cada una según su relevancia para el tema actual. El self-attention funciona así: para cada token, el modelo puntúa a todos los demás por relevancia y construye el significado de ese token como una mezcla ponderada de los que importan. La analogía se rompe en un punto que conviene nombrar: tú sintonizas porque entiendes el tema, mientras que los puntajes de relevancia del modelo son pesos estadísticos aprendidos, sin comprensión detrás.

Córrelo sobre la frase del trofeo. Cuando el modelo procesa "era", el self-attention puntúa cada token anterior. "Trofeo" y "maleta" puntúan alto porque ambos son sustantivos candidatos. Después "muy grande" inclina la balanza hacia "trofeo", porque los datos de entrenamiento contienen incontables frases donde lo que no cabe es lo que es demasiado grande. Cambia una palabra a "porque era muy pequeña" y el mismo mecanismo mueve el peso hacia "maleta". Una arquitectura, ninguna regla escrita a mano, y la resolución sale de pesos aprendidos.

Positional encoding: devolver el orden

Leer todo a la vez crea un problema nuevo. Si el modelo ve todos los tokens de forma simultánea, "el perro mordió al hombre" y "el hombre mordió al perro" llegan como la misma bolsa de palabras. El orden carga significado, y la lectura paralela lo tira.

La solución es el positional encoding. Como lo describe AWS, "el positional encoding agrega información al embedding de cada token para indicar su posición en la secuencia", porque "el modelo en sí no procesa datos secuenciales en orden de forma inherente". La representación numérica de cada token recibe una señal de posición mezclada, así que el token 4 y el token 40 se distinguen aunque se procesen en el mismo instante.

Es un buen ejemplo de un canje arquitectónico que se paga en otro lado. El paralelismo compró velocidad y alcance largo, y el positional encoding es la cuenta.

Encoder y decoder

AWS describe la arquitectura completa en dos mitades. El encoder "lee y procesa toda la secuencia de datos de entrada" y la transforma en "una representación matemática compacta". El decoder "toma ese resumen y, paso a paso, genera la secuencia de salida".

No todos los modelos usan las dos mitades. Los modelos hechos para generar texto, la familia GPT entre ellos, son decoder-only: toman los tokens que llevan y producen el siguiente. Los modelos hechos para producir embeddings se apoyan en el encoder, porque su trabajo termina en la representación numérica compacta y nunca se vuelve texto. Esa división importa para la próxima lección, donde los modelos de embeddings tienen su propia sección.

Parámetros: lo que el modelo aprendió

Durante el entrenamiento, un transformer ajusta millones o miles de millones de números hasta que sus predicciones dejan de mejorar. AWS los nombra directamente: "los pesos y sesgos junto con los embeddings se conocen como parámetros del modelo. Las grandes redes neuronales basadas en transformers pueden tener miles de millones y miles de millones de parámetros". AWS cita GPT-3 con 175 mil millones de parámetros y Jurassic-1 con 178 mil millones como ejemplos de esa escala.

Aquí va la idea equivocada que conviene matar ahora, porque genera respuestas incorrectas durante todo el curso. Los parámetros no son una copia comprimida de los datos de entrenamiento, y el modelo no tiene ningún índice donde buscar. Esos 175 mil millones de números codifican regularidades estadísticas: qué tokens siguen a cuáles, qué palabras se comportan parecido, qué formas de frase son gramaticales. Cuando un LLM te dice un dato, no está recuperando un documento guardado, está generando la continuación que esos pesos vuelven más probable. Ese es el mecanismo completo detrás de las alucinaciones, y por eso el examen sigue emparejando modelos fundacionales con recuperación aumentada y grounding.

La cantidad de parámetros es una señal aproximada de capacidad, no una garantía. Un modelo más grande suele manejar mejor el razonamiento difícil, y también cuesta más por token y responde más lento. El Dominio 2 vuelve a ese canje una y otra vez.

Pre-entrenamiento sin etiquetas

El aprendizaje supervisado tradicional necesita ejemplos etiquetados: esta transacción es fraude, esta no. Etiquetar es lento y caro, y por eso los conjuntos de datos del ML tradicional se mantienen chicos.

Los modelos fundacionales lo esquivan. AWS describe los LLM basados en transformers como "capaces de entrenamiento no supervisado" mediante "auto-aprendizaje", donde "aprenden a entender gramática básica, lenguajes y conocimiento". El truco es que el texto crudo es su propia clave de respuestas. Esconde una palabra y pide al modelo que la prediga, y ya tienes un ejemplo de entrenamiento con respuesta correcta, generado gratis. Haz eso sobre un corpus enorme y de ese mismo objetivo caen la gramática, los hechos, el estilo y los patrones de razonamiento.

Por esto los modelos fundacionales pueden entrenarse con datos amplios y en su mayoría sin etiquetar mientras un clasificador de fraude no puede. El etiquetado humano no desaparece del todo, pero se mueve más tarde en el proceso, al ajuste fino y a la alineación, donde un conjunto curado mucho más pequeño da forma al comportamiento del modelo. La lección sobre el ciclo de vida del FM vuelve exactamente a esa división.

Modelo fundacional, LLM y modelo tradicional

Estos tres términos viven en niveles distintos, y el examen prueba si los mantienes separados.

TérminoAlcanceEntrenado conSalida
Modelo de ML tradicionalUna tareaUn conjunto etiquetado para esa tareaUna etiqueta o un número
Modelo fundacionalMuchas tareas, cualquier modalidadDatos masivos y diversos, casi sin etiquetarTexto, imágenes o embeddings
Large language modelMuchas tareas de textoCorpus de texto masivosTexto

La relación va en un solo sentido. Todo LLM es un modelo fundacional, pero no todo modelo fundacional es un LLM. Un generador de imágenes y un modelo de embeddings de texto son ambos modelos fundacionales, y ninguno es un large language model. Si una pregunta describe un modelo que convierte entradas en vectores para búsqueda por similitud, "LLM" es la etiqueta equivocada aunque el modelo sea grande y esté entrenado con texto.

Consejos para el examen

  • Las palabras "amplio", "diverso", "sin etiquetar" y "adaptado a muchas tareas" apuntan a modelo fundacional. Un modelo entrenado con un conjunto etiquetado para un solo trabajo es ML tradicional, por grande que sea.
  • "LLM" es el término más estrecho. Si el escenario menciona imágenes, video o embeddings como salida, responde modelo fundacional, no LLM. Las opciones que tratan ambos términos como intercambiables suelen ser la trampa.
  • En preguntas de transformer, el diferenciador es el procesamiento paralelo de la secuencia completa, con self-attention pesando relevancia y positional encoding devolviendo el orden. Si una opción dice que un transformer procesa tokens uno a la vez, está describiendo una RNN.
  • Espera un distractor que afirme que el pre-entrenamiento necesita datos etiquetados. No los necesita. El pre-entrenamiento auto-supervisado sobre texto sin etiquetar es justo lo que hace posible la escala de los modelos fundacionales.
  • No leas la cantidad de parámetros como garantía de exactitud. Los modelos más grandes razonan mejor en general y siempre cuestan más por token, y ninguno deja de alucinar.

La idea que debes llevarte: un modelo fundacional es una pila enorme de pesos aprendidos que predice continuaciones plausibles, y todo lo que construyes encima es un intento de dirigir esas predicciones hacia algo útil y verdadero. Para dirigirlas, primero tienes que saber qué está consumiendo el modelo, que no son palabras. La próxima lección descompone la entrada en tokens, chunks y embeddings.