AWS Certified AI Practitioner

Qué hace bien la IA generativa

Las cuatro ventajas que nombra el examen, explicadas desde lo que un modelo fundacional puede hacer y un modelo entrenado a medida no: adaptarse sin reentrenar, responder sin ciclo de desarrollo, sostener una conversación y producir contenido que no existía.

Principiante 16 minutos 4 Objetivos de aprendizaje
  1. Describir las ventajas de la IA generativa que nombra el exam guide: adaptabilidad, capacidad de respuesta, capacidades conversacionales y generación de contenido
  2. Explicar por qué un modelo preentrenado elimina el costo de etiquetado y reentrenamiento que carga el ML tradicional
  3. Comparar un modelo fundacional con un modelo entrenado a medida en una tarea que ambos podrían resolver
  4. Separar las ventajas que el examen atribuye a la tecnología de las que atribuye a la plataforma de AWS

Un equipo pasa seis semanas construyendo un clasificador de sentimiento para reseñas de producto. Etiqueta 20.000 reseñas, entrena un modelo, lo ajusta, lo despliega. Funciona. Entonces el product manager pide el mismo análisis de sentimiento sobre correos de soporte, más una etiqueta de tema en cada reseña, más un borrador de respuesta para las negativas.

Con el clasificador, eso son tres proyectos nuevos, cada uno con su propio esfuerzo de etiquetado. Con un modelo fundacional, son tres frases agregadas a un prompt, funcionando esa misma tarde.

Esa brecha es la primera de las cuatro ventajas que nombra el exam guide en el Task Statement 2.2: "adaptabilidad, capacidad de respuesta, capacidades conversacionales, capacidad de generar contenido". Cada una suena a folleto de marketing hasta que le pones precio contra lo que costaba el enfoque anterior.

Adaptabilidad: la tarea sale del entrenamiento

La tarea de un modelo supervisado la deciden sus etiquetas, y las etiquetas se eligen antes de que empiece el entrenamiento. Entrena con etiquetas de reseña positiva y negativa y el modelo devolverá una de dos clases para una reseña. Para siempre. Pídele una etiqueta de tema y no existe mecanismo alguno con el que pueda responder, porque nada en su capa de salida puede representar un tema.

Un modelo fundacional funciona al revés. El preentrenamiento le dio capacidad amplia sin ninguna tarea atada, así que la tarea llega en el momento de la inferencia, escrita en el prompt. Los mismos pesos, otra instrucción, otro trabajo.

La consecuencia práctica es un cambio en la unidad de trabajo. En ML tradicional, cambiar lo que hace el sistema significa una corrida de entrenamiento: juntar etiquetas, entrenar, evaluar, redesplegar, medido en días o semanas. Con un modelo fundacional significa editar texto, medido en minutos. Los equipos lo sienten como un cambio en qué vale la pena intentar, porque una tarea que jamás justificaría un proyecto de seis semanas es fácil de justificar como un párrafo.

Dos límites mantienen esto honesto. La adaptabilidad no es exactitud: un clasificador entrenado con 20.000 reseñas etiquetadas suele ganarle a un modelo general en esas reseñas concretas, y ese intercambio es real. Y la adaptabilidad no es gratis: el prompt que carga la instrucción se factura en cada petición, para siempre, mientras que el costo de entrenar el clasificador se pagó una sola vez.

El examen tiene un nombre para la medición de esta propiedad, cross-domain performance, y aparece en el objetivo de métricas de negocio que cubre la última lección de este tema.

Capacidad de respuesta: dos sentidos, y el examen evalúa ambos

"Capacidad de respuesta" es la ventaja que más se malinterpreta, porque dos propiedades distintas viajan con ese nombre.

La primera es latencia. Un modelo fundacional responde una petición arbitraria en tiempo real, normalmente enviando los tokens en streaming a medida que los produce, así que una persona puede leer el inicio de la respuesta mientras el final todavía se genera. Eso es lo que hace posible una conversación en vivo. AWS ofrece además inferencia optimizada para latencia en Amazon Bedrock para modelos seleccionados, que enruta las peticiones por una vía de servicio más rápida sin cambiar el modelo ni el prompt.

La segunda es capacidad de respuesta ante el cambio: el sistema atiende una petición que nadie anticipó, sin un ciclo de desarrollo sentado entre la petición y la respuesta. Cuando un producto nuevo se lanza el martes, el asistente puede hablar de él el martes, siempre que los detalles lleguen al prompt.

Acá va el error que conviene nombrar, porque es un distractor tentador. La capacidad de respuesta no significa que un modelo fundacional sea más rápido que la alternativa. Un clasificador pequeño entrenado a medida responde en milisegundos; un modelo de lenguaje grande tarda entre cientos de milisegundos y varios segundos, y se vuelve más lento cuanto más larga es la respuesta. Si un escenario exige una decisión en menos de 50 milisegundos dentro de un flujo de pago, la IA generativa es la herramienta equivocada y el examen espera que lo digas. Capacidad de respuesta significa suficientemente rápido para sostener una conversación y rápido para cambiar, no el más rápido en términos absolutos.

Capacidad conversacional: lenguaje natural en los dos extremos

La tercera ventaja es la que nota el usuario, y la razón por la que la IA generativa llegó tan rápido a gente no técnica. La entrada es una frase en vez de un formulario, un esquema o un lenguaje de consulta. La salida es una frase en vez de una etiqueta de clase o un número.

Donde se gana su lugar es en el multiturno. Un analista pregunta "¿qué contratos se renuevan este trimestre?", después "solo los de más de $100k", después "ordena esos por fecha de renovación y dime cuáles tienen cláusula de renovación automática". Cada seguimiento no significa nada por su cuenta. Juntos son una conversación, y el modelo resuelve "esos" y "los de" contra lo que vino antes.

Ahora el mecanismo, porque al examen le gusta la distancia entre cómo se siente esto y cómo funciona. El modelo no tiene memoria. Pesos congelados, una petición a la vez. Lo que crea la ilusión es que tu aplicación reenvía los turnos anteriores como tokens de entrada en cada petición nueva, así que el historial llega como parte del prompt. De ahí salen tres consecuencias directas, y las tres son material de examen: las conversaciones largas cuestan progresivamente más, una conversación termina excediendo la ventana de contexto, y nada se recuerda al terminar la sesión salvo que lo guardes a propósito.

Generar contenido: salida que antes no existía

La cuarta ventaja es la que le da nombre a toda la categoría. Un modelo tradicional selecciona: elige una clase, puntúa una probabilidad, predice un número que ya tenía una respuesta correcta en los datos. Un modelo generativo compone algo nuevo.

Eso cubre las salidas obvias, texto, imágenes, audio, video y código, y una que es fácil pasar por alto. AWS lista la generación de datos etiquetados sintéticos como una aplicación de optimización de procesos de negocio, lo que significa que un trabajo útil para la IA generativa es fabricar datos de entrenamiento para machine learning tradicional. Un equipo con pocos ejemplos etiquetados de fraude puede generar casos plausibles para reforzar un clasificador. Esa inversión aparece en preguntas de escenario.

La generación es también donde se concentran los riesgos, exactamente por la razón que la hace poderosa: nada restringe la salida contra una fuente. La próxima lección trata de eso.

La ventaja debajo de las cuatro: no hay nada que etiquetar

Separa las cuatro ventajas y debajo de casi todas aparece el mismo hecho. La parte cara ya ocurrió, en el centro de datos de otro, hace meses.

Pon los dos enfoques lado a lado sobre la misma tarea, sentimiento en reseñas de producto:

Clasificador entrenado a medidaModelo fundacional
Datos necesarios antes del primer resultadoUnas 20.000 reseñas etiquetadasNinguno
Tiempo hasta un resultado utilizableSemanasHoras
Agregar una segunda tareaEtiquetas nuevas, entrenamiento nuevo, despliegue nuevoUna frase más en el prompt
Forma del costoEntrenamiento pagado una vez, inferencia muy barataSin entrenamiento, cobro por token en cada petición
Exactitud en esa tarea estrechaNormalmente mayorNormalmente suficiente, a veces mejor
Quién puede cambiar su comportamientoUn ingeniero de MLCualquiera que escriba instrucciones claras

La fila que decide proyectos reales es la forma del costo. Un modelo fundacional elimina la inversión inicial y la reemplaza por un cargo por petición que no termina nunca. Con 500 peticiones al día ese intercambio es obviamente bueno. Con 50 millones de peticiones al día la inferencia barata del clasificador puede ganar por mucho, incluso contando el esfuerzo de etiquetado. El volumen es lo que da vuelta la respuesta, y un escenario que menciona volumen de peticiones muy alto con una tarea estrecha y estable normalmente te está alejando de un modelo fundacional.

Leer las señales de un escenario

Cuatro señales empujan hacia la IA generativa, y conviene llevarlas como conjunto:

  • Entrada no estructurada que no encaja en ningún esquema: texto libre, imágenes, audio, documentos mezclados.
  • Salida variable donde la respuesta es un párrafo o una imagen, sin una única respuesta correcta contra la cual entrenar.
  • Varias tareas relacionadas que necesitarían cada una su propio modelo.
  • Sin dataset etiquetado, y sin forma barata de construirlo.

Tres empujan en contra:

  • Una sola predicción estrecha a volumen muy alto con etiquetas de sobra, donde un modelo pequeño es más barato y más exacto.
  • Un presupuesto de latencia duro medido en decenas de milisegundos.
  • El requisito de que la misma entrada produzca siempre la misma salida, que es el tema de la próxima lección.

Consejos para el examen

  • Aprende las cuatro ventajas nombradas tal cual: adaptabilidad, capacidad de respuesta, capacidades conversacionales, capacidad de generar contenido. Las listas distractoras suelen meter exactitud, determinismo o interpretabilidad, que son justo las propiedades donde la IA generativa es más débil.
  • Mantén separados el Task Statement 2.2 y el 2.3. Ventajas de la IA generativa como tecnología son las cuatro de arriba. Ventajas de los servicios de IA generativa de AWS son accesibilidad, menor barrera de entrada, eficiencia, costo-efectividad y velocidad de salida al mercado. La redacción de la pregunta te dice cuál quiere.
  • La adaptabilidad trata de especificar la tarea en el prompt en vez de en las etiquetas. Cualquier opción que describa reentrenar está describiendo el enfoque tradicional.
  • Capacidad de respuesta no significa menor latencia que toda alternativa. Un escenario con presupuesto estricto en milisegundos sobre una predicción estrecha apunta a ML tradicional.
  • La memoria conversacional es contexto reenviado, no estado guardado. Las preguntas sobre costo creciente en conversaciones largas, o sobre chocar con la ventana de contexto, salen de este hecho.
  • Atención al volumen muy alto sumado a una tarea estrecha y estable. Esa combinación favorece un modelo entrenado a medida aunque un modelo fundacional pueda hacer el trabajo.

Una idea para llevarte: cada ventaja de esta lección viene de que el modelo es general y ya está entrenado, y cada limitación de la próxima lección viene de esos mismos dos hechos. La generalidad es por qué se adapta, y también es por qué no tiene idea de cuándo está equivocado.