AWS Certified AI Practitioner
Tokens, chunking et embeddings
Suivez un document du texte brut jusqu'à un index vectoriel interrogeable : comment le texte devient des tokens, pourquoi les longs documents sont découpés en chunks, et comment les embeddings transforment le sens en nombres comparables.
Débutant 20 minutes 4 Objectifs d'apprentissage
- Définir un token et expliquer pourquoi un token n'est pas un mot
- Expliquer pourquoi les documents sont découpés en chunks et comparer les stratégies de chunking d'Amazon Bedrock
- Décrire ce qu'est un embedding et comment la similarité vectorielle retrouve du contenu proche
- Retracer le parcours d'un document dans la chaîne chunk, embedding et indexation qui porte la récupération
