Qu’est-ce qu’un jeton, et pourquoi pas des mots ?

Questions d’entrevue LLM et IA générative

Juniortokenisationfondamentaux

Un jeton est l’unité que le modèle lit et produit : un fragment de texte fréquent, quelque part entre le caractère et le mot. « incompréhensible » se découpe en plusieurs jetons, « le » en un seul, un nom propre rare en cinq ou six.

Pourquoi pas des mots

Un vocabulaire de mots pose deux problèmes insolubles. Il est infini en pratique — noms propres, fautes de frappe, néologismes, identifiants, code — et chaque mot absent devient un jeton « inconnu » qui détruit l’information. Et il est gigantesque dans les langues à morphologie riche, où chaque forme fléchie serait une entrée distincte.

Pourquoi pas des caractères

Le vocabulaire devient minuscule, mais les séquences deviennent cinq fois plus longues. Comme le coût de l’attention est quadratique en longueur, c’est inabordable, et le modèle passe sa capacité à réapprendre l’orthographe.

Le compromis : les sous-mots

Les algorithmes utilisés — BPE, WordPiece, Unigram — partent des caractères et fusionnent itérativement les paires les plus fréquentes du corpus jusqu’à atteindre une taille de vocabulaire cible. Les mots courants finissent en un jeton, les mots rares se décomposent en morceaux qui existent tous. Rien n’est jamais hors vocabulaire, et la longueur reste raisonnable.

Les conséquences concrètes, qui font l’intérêt de la question

C’est ici qu’un entretien vérifie si vous avez travaillé avec ces modèles ou seulement lu à leur sujet.

  • On facture au jeton. Un texte français consomme typiquement 20 à 30 % de jetons de plus que le même texte en anglais, parce que les fusions ont été apprises sur un corpus majoritairement anglophone. Cela se paie deux fois : en coût et en fenêtre de contexte utile.
  • Le modèle ne voit pas les lettres. D’où sa difficulté historique à compter les caractères d’un mot ou à l’épeler à l’envers : il manipule des blocs, pas des lettres.
  • L’arithmétique en souffre. Un nombre découpé de façon irrégulière rend le calcul chiffre par chiffre difficile. Les tokeniseurs récents découpent les nombres par groupes réguliers, précisément pour cela.
  • Les espaces comptent. Un mot précédé d’une espace et le même mot en début de ligne sont souvent des jetons différents, ce qui explique des variations de sortie apparemment inexplicables.

Ce qu’il faut retenir pour répondre

La tokenisation est un choix d’ingénierie fait avant l’entraînement, figé ensuite, et responsable d’une partie des bizarreries qu’on reproche aux modèles. Un candidat qui relie une limite observée — mauvais comptage de lettres, coût élevé dans une langue non anglaise — à ce choix montre qu’il comprend la chaîne complète.

Toutes les questions LLM et IA générative