AWS Certified AI Practitioner

Tokens, chunking et embeddings

Suivez un document du texte brut jusqu'à un index vectoriel interrogeable : comment le texte devient des tokens, pourquoi les longs documents sont découpés en chunks, et comment les embeddings transforment le sens en nombres comparables.

Débutant 20 minutes 4 Objectifs d'apprentissage
  1. Définir un token et expliquer pourquoi un token n'est pas un mot
  2. Expliquer pourquoi les documents sont découpés en chunks et comparer les stratégies de chunking d'Amazon Bedrock
  3. Décrire ce qu'est un embedding et comment la similarité vectorielle retrouve du contenu proche
  4. Retracer le parcours d'un document dans la chaîne chunk, embedding et indexation qui porte la récupération