AWS Certified AI Practitioner

O que a IA generativa faz bem

As quatro vantagens que o exame nomeia, ancoradas no que um modelo de fundação consegue fazer e um modelo treinado sob medida não: adaptar sem retreinar, responder sem ciclo de build, sustentar uma conversa e produzir conteúdo que não existia.

Iniciante 16 minutos 4 Objetivos de aprendizado
  1. Descrever as vantagens da IA generativa nomeadas no guia do exame: adaptabilidade, responsividade, capacidades conversacionais e geração de conteúdo
  2. Explicar por que um modelo de fundação pré-treinado elimina o custo de rotulagem e de retreinamento que o ML tradicional carrega
  3. Comparar um modelo de fundação com um modelo treinado sob medida em uma tarefa que os dois conseguem executar
  4. Separar as vantagens que o exame atribui à tecnologia daquelas que ele atribui à plataforma AWS

Um time passa seis semanas construindo um classificador de sentimento para avaliações de produto. Eles rotulam 20.000 avaliações, treinam o modelo, ajustam, publicam. Funciona. Aí a pessoa de produto pede a mesma leitura de sentimento em e-mails de suporte, mais uma tag de assunto em cada avaliação, mais um rascunho de resposta para as negativas.

Com o classificador, isso são três projetos novos, cada um com o próprio esforço de rotulagem. Com um modelo de fundação, são três frases acrescentadas a um prompt, funcionando naquela tarde.

Essa distância é a primeira das quatro vantagens que o guia do exame nomeia no Task Statement 2.2: "adaptabilidade, responsividade, capacidades conversacionais, capacidade de gerar conteúdo". Cada uma soa como marketing até você comparar com o preço da abordagem anterior.

Adaptabilidade: a tarefa sai do treinamento

A tarefa de um modelo supervisionado é decidida pelos rótulos dele, e os rótulos são escolhidos antes do treinamento começar. Treine com rótulos de avaliação positiva e negativa e o modelo devolve uma de duas classes para uma avaliação. Para sempre. Peça uma tag de assunto e não existe mecanismo para ele responder, porque nada na camada de saída consegue representar um assunto.

Um modelo de fundação funciona ao contrário. O pré-treinamento deu a ele capacidade ampla sem tarefa nenhuma amarrada, então a tarefa chega no momento da inferência, escrita no prompt. Mesmos pesos, instrução nova, trabalho diferente.

A consequência prática é uma mudança na unidade de trabalho. No ML tradicional, mudar o que o sistema faz significa uma execução de treinamento: juntar rótulos, treinar, avaliar, publicar de novo, medido em dias ou semanas. Com um modelo de fundação significa editar texto, medido em minutos. Os times sentem isso como uma mudança no que vale a pena tentar, porque uma tarefa que nunca justificaria um projeto de seis semanas é fácil de justificar como um parágrafo.

Dois limites mantêm isso honesto. Adaptabilidade não é exatidão: um classificador treinado com 20.000 avaliações rotuladas vai frequentemente ganhar de um modelo geral naquelas avaliações especificamente, e essa é uma troca real. E adaptabilidade não é de graça: o prompt que carrega a instrução é cobrado em toda requisição, para sempre, enquanto o custo de treinamento do classificador foi pago uma vez.

O exame tem um nome para a medição dessa propriedade, cross-domain performance, e ele aparece no objetivo de métricas de negócio coberto na última lição deste tópico.

Responsividade: dois sentidos, os dois cobrados

"Responsividade" é a vantagem com maior chance de ser lida errado, porque duas propriedades diferentes viajam com esse nome.

A primeira é latência. Um modelo de fundação responde a uma requisição arbitrária em tempo real, normalmente transmitindo tokens conforme os produz, então uma pessoa consegue ler o começo de uma resposta enquanto o fim ainda está sendo gerado. É isso que torna a conversa ao vivo possível. A AWS também oferece latency-optimized inference no Amazon Bedrock para modelos selecionados, que roteia requisições por um caminho de atendimento mais rápido sem mudar o modelo nem o prompt.

A segunda é responsividade a mudanças: o sistema atende um pedido que ninguém antecipou, sem um ciclo de build entre o pedido e a resposta. Quando um produto novo é lançado na terça, o assistente consegue falar dele na terça, desde que os detalhes cheguem ao prompt.

Aqui está o mal-entendido que vale nomear, porque ele é um distrator tentador. Responsividade não significa que um modelo de fundação é mais rápido que a alternativa. Um classificador pequeno sob medida responde em milissegundos; um large language model leva de centenas de milissegundos a vários segundos, e fica mais lento conforme a resposta cresce. Se um cenário exige uma decisão em menos de 50 milissegundos dentro de um fluxo de pagamento, a IA generativa é a ferramenta errada e o exame espera que você diga isso. Responsividade significa rápido o bastante para sustentar uma conversa e rápido para mudar, não o mais rápido em termos absolutos.

Capacidade conversacional: linguagem natural nas duas pontas

A terceira vantagem é a que os usuários percebem, e a razão de a IA generativa ter chegado tão rápido a pessoas não técnicas. A entrada é uma frase em vez de um formulário, um schema ou uma linguagem de consulta. A saída é uma frase em vez de um rótulo de classe ou um número.

O multi-turno é onde ela ganha o lugar dela. Uma analista pergunta "quais contratos renovam neste trimestre?", depois "só os acima de US$ 100 mil", depois "ordene por data de renovação e diga quais têm cláusula de renovação automática". Cada complemento é sem sentido sozinho. Juntos são uma conversa, e o modelo resolve "os" e "quais" contra o que veio antes.

Agora o mecanismo, porque o exame gosta da distância entre como isso parece e como funciona. O modelo não tem memória. Pesos congelados, uma requisição por vez. O que cria a ilusão é que a sua aplicação reenvia os turnos anteriores como tokens de entrada a cada nova requisição, então o histórico chega como parte do prompt. Três consequências saem daí direto, e as três são matéria de exame: conversas longas custam progressivamente mais, uma conversa acaba excedendo a janela de contexto, e nada é lembrado depois que a sessão termina a menos que você guarde de propósito.

Gerar conteúdo: saída que não existia antes

A quarta vantagem é a que dá nome à categoria inteira. Um modelo tradicional seleciona: escolhe uma classe, atribui uma probabilidade, prevê um número que já tinha uma resposta certa nos dados. Um modelo generativo compõe algo novo.

Isso cobre as saídas óbvias, texto, imagem, áudio, vídeo e código, e uma que passa fácil despercebida. A AWS lista a geração de dados sintéticos rotulados como uma aplicação de processos de negócio, o que significa que um trabalho útil para a IA generativa é fabricar dados de treinamento para machine learning tradicional. Um time com poucos exemplos rotulados de fraude consegue gerar exemplos plausíveis para reforçar um classificador. Essa inversão aparece em questões de cenário.

A geração também é onde os riscos se concentram, exatamente pela razão que a torna poderosa: nada restringe a saída contra uma fonte. A próxima lição é sobre isso.

A vantagem por baixo das quatro: nada para rotular

Separe as quatro vantagens e o mesmo fato aparece por baixo da maioria delas. A parte cara já aconteceu, no data center de outra pessoa, meses atrás.

Coloque as duas abordagens lado a lado na mesma tarefa, sentimento em avaliações de produto:

Classificador sob medidaModelo de fundação
Dados necessários antes do primeiro resultadoCerca de 20.000 avaliações rotuladasNenhum
Tempo até um resultado funcionalSemanasHoras
Adicionar uma segunda tarefaNovos rótulos, novo treinamento, nova publicaçãoMais uma frase no prompt
Formato do custoTreinamento pago uma vez, inferência muito barataSem treinamento, inferência por token em toda requisição
Exatidão naquela única tarefa estreitaNormalmente maiorNormalmente boa o bastante, às vezes melhor
Quem consegue mudar o comportamentoUma pessoa de engenharia de MLQualquer pessoa que escreva instruções claras

A linha que decide projetos reais é o formato do custo. Um modelo de fundação remove o investimento inicial e o troca por uma cobrança por requisição que nunca acaba. Com 500 requisições por dia essa troca é obviamente boa. Com 50 milhões de requisições por dia a inferência barata do classificador pode ganhar por uma margem larga, mesmo contando o esforço de rotulagem. O volume é o que vira a resposta, e um cenário que menciona volume de requisições muito alto com uma tarefa estreita e estável normalmente está te afastando de um modelo de fundação.

Lendo os sinais em um cenário

Quatro sinais empurram na direção da IA generativa, e vale carregá-los como conjunto:

  • Entrada não estruturada que nenhum schema encaixa: texto livre, imagens, áudio, documentos misturados.
  • Saída variável em que a resposta é um parágrafo ou uma imagem, sem uma resposta única correta para treinar contra.
  • Várias tarefas relacionadas que precisariam de um modelo cada.
  • Nenhum dataset rotulado, e nenhum jeito barato de construir um.

Três empurram para longe:

  • Uma previsão estreita em volume muito alto com rótulos de sobra, onde um modelo pequeno é mais barato e mais exato.
  • Um orçamento de latência apertado medido em dezenas de milissegundos.
  • Uma exigência de que a mesma entrada sempre produza a mesma saída, que é o assunto da próxima lição.

Dicas para o exame

  • Aprenda as quatro vantagens nomeadas como estão escritas: adaptabilidade, responsividade, capacidades conversacionais, capacidade de gerar conteúdo. Listas distratoras normalmente trocam por exatidão, determinismo ou interpretabilidade, que são exatamente as propriedades em que a IA generativa é mais fraca.
  • Mantenha os Task Statements 2.2 e 2.3 separados. Vantagens da IA generativa como tecnologia significa as quatro acima. Vantagens dos serviços de IA generativa da AWS significa acessibilidade, menor barreira de entrada, eficiência, custo-benefício e velocidade de entrada no mercado. O enunciado avisa qual lista ele quer.
  • Adaptabilidade é especificar a tarefa no prompt em vez de nos rótulos. Qualquer opção descrevendo retreinamento está descrevendo a abordagem tradicional.
  • Responsividade não significa latência menor que toda alternativa. Um cenário com orçamento rígido em milissegundos sobre uma única previsão estreita aponta para ML tradicional.
  • Memória conversacional é contexto reenviado, não estado guardado. Perguntas sobre custo crescente em conversas longas, ou sobre bater na janela de contexto, saem desse fato.
  • Fique atento a volume muito alto somado a uma tarefa estreita e estável. Essa combinação favorece um modelo sob medida mesmo que um modelo de fundação desse conta.

Uma ideia para levar: toda vantagem desta lição vem de o modelo ser geral e já treinado, e toda limitação da próxima lição vem desses mesmos dois fatos. A generalidade é por que ele se adapta, e é também por que ele não faz ideia de quando está errado.