AWS Certified AI Practitioner

Modelos multimodais e de difusão

Entenda como a IA generativa funciona além do texto: o que torna um modelo multimodal, como os modelos de difusão constroem imagens removendo ruído passo a passo e onde a difusão se separa das GANs e dos modelos de linguagem.

Intermediário 18 minutos 4 Objetivos de aprendizado
  1. Definir um modelo multimodal e distingui-lo de uma arquitetura multi-model
  2. Explicar a difusão direta e a reversa e como um prompt de texto guia a geração de imagem
  3. Descrever por que modelos de difusão trabalham no espaço latente em vez de nos pixels brutos
  4. Comparar modelos de difusão com GANs e com modelos de linguagem baseados em transformer