AWS Certified AI Practitioner
Modelos multimodais e de difusão
Entenda como a IA generativa funciona além do texto: o que torna um modelo multimodal, como os modelos de difusão constroem imagens removendo ruído passo a passo e onde a difusão se separa das GANs e dos modelos de linguagem.
Intermediário 18 minutos 4 Objetivos de aprendizado
- Definir um modelo multimodal e distingui-lo de uma arquitetura multi-model
- Explicar a difusão direta e a reversa e como um prompt de texto guia a geração de imagem
- Descrever por que modelos de difusão trabalham no espaço latente em vez de nos pixels brutos
- Comparar modelos de difusão com GANs e com modelos de linguagem baseados em transformer
