Un jeton est l’unité que le modèle lit et produit : un fragment de texte fréquent, quelque part entre le caractère et le mot. « incompréhensible » se découpe en plusieurs jetons, « le » en un seul, un nom propre rare en cinq ou six.
Un vocabulaire de mots pose deux problèmes insolubles. Il est infini en pratique — noms propres, fautes de frappe, néologismes, identifiants, code — et chaque mot absent devient un jeton « inconnu » qui détruit l’information. Et il est gigantesque dans les langues à morphologie riche, où chaque forme fléchie serait une entrée distincte.
Le vocabulaire devient minuscule, mais les séquences deviennent cinq fois plus longues. Comme le coût de l’attention est quadratique en longueur, c’est inabordable, et le modèle passe sa capacité à réapprendre l’orthographe.
Les algorithmes utilisés — BPE, WordPiece, Unigram — partent des caractères et fusionnent itérativement les paires les plus fréquentes du corpus jusqu’à atteindre une taille de vocabulaire cible. Les mots courants finissent en un jeton, les mots rares se décomposent en morceaux qui existent tous. Rien n’est jamais hors vocabulaire, et la longueur reste raisonnable.
C’est ici qu’un entretien vérifie si vous avez travaillé avec ces modèles ou seulement lu à leur sujet.
La tokenisation est un choix d’ingénierie fait avant l’entraînement, figé ensuite, et responsable d’une partie des bizarreries qu’on reproche aux modèles. Un candidat qui relie une limite observée — mauvais comptage de lettres, coût élevé dans une langue non anglaise — à ce choix montre qu’il comprend la chaîne complète.