AWS Certified AI Practitioner

Modèles multimodaux et modèles de diffusion

Comprenez comment l'IA générative fonctionne au-delà du texte : ce qui rend un modèle multimodal, comment les modèles de diffusion construisent une image en retirant du bruit étape par étape, et en quoi la diffusion diffère des GAN et des modèles de langage à transformers.

Intermédiaire 18 minutes 4 Objectifs d'apprentissage
  1. Définir un modèle multimodal et le distinguer d'une architecture multi-modèles
  2. Expliquer la diffusion avant et arrière et comment un prompt textuel oriente la génération d'image
  3. Décrire pourquoi les modèles de diffusion travaillent dans un espace latent plutôt que sur les pixels bruts
  4. Comparer les modèles de diffusion aux GAN et aux modèles de langage à base de transformers