Le modèle n’est pas entraîné à dire vrai. Il est entraîné à produire du texte vraisemblable. Une référence bibliographique inventée, avec des auteurs plausibles et un titre crédible, est un excellent texte au sens de l’objectif d’entraînement. C’est là toute l’origine du phénomène, et c’est par là qu’il faut commencer à répondre.
L’objectif lui-même. Aucun terme de la fonction de perte ne pénalise le faux plus que le vrai. La seule chose optimisée est la probabilité du jeton suivant.
L’absence de frontière de connaissance. Le modèle n’a pas de représentation fiable de « je ne sais pas ». Il n’y a pas de compteur de confiance factuelle : il y a une distribution sur des jetons, et elle est toujours définie.
La pression de l’alignement. L’étape d’alignement sur préférences humaines récompense les réponses complètes et serviables. Les évaluateurs préfèrent une réponse assurée à un aveu d’ignorance, et le modèle apprend cette préférence. Une partie des hallucinations est donc enseignée.
Les faits rares. Ce qui apparaît une fois dans le corpus n’est pas mémorisé de façon récupérable. Le modèle interpole alors depuis les patrons voisins — d’où les biographies mélangées de deux homonymes.
La génération autorégressive. Un premier jeton engageant une affirmation fausse force la suite à la cohérence. Le modèle ne revient pas en arrière ; il justifie.
Ancrer sur des sources fournies. C’est de loin le levier principal : donner les documents dans le contexte et demander une réponse qui s’y limite. Le RAG ne supprime pas les hallucinations, mais il déplace la tâche de « se souvenir » vers « lire », et le modèle est bien meilleur à lire.
Exiger des citations vérifiables et les valider mécaniquement. Faire pointer chaque affirmation vers un passage fourni, puis vérifier en aval que le passage cité existe et contient bien l’information. Une citation non vérifiable est traitée comme une erreur, pas comme un détail.
Autoriser explicitement l’abstention. Une consigne qui donne la permission de répondre que l’information n’est pas dans les sources fonctionne bien mieux qu’une interdiction d’inventer. On travaille contre une pression apprise ; il faut lui offrir une issue valorisée.
Baisser la température sur les tâches factuelles. Effet réel mais modeste : cela réduit les inventions de surface, pas les erreurs dont le modèle est confiant.
Décomposer la tâche. Une chaîne de petites étapes vérifiables produit moins d’inventions qu’une seule requête large, et surtout on voit où elle a dérapé.
Vérifier par la contrainte du domaine. Si la sortie est un identifiant client, un code produit ou un numéro de compte, la vérifier dans la base de référence. C’est la garantie la plus solide, parce qu’elle ne dépend pas du modèle.
Écrire « ne pas halluciner » ou « répondre uniquement avec des informations vraies » dans l’invite. Cela n’a pas d’effet mesurable : le modèle n’a pas accès à un interrupteur de vérité qu’il aurait laissé sur off.
Demander au modèle sa confiance sans dispositif particulier. Les probabilités verbalisées sont mal calibrées et généralement optimistes. En revanche, comparer plusieurs échantillons indépendants et mesurer leur accord donne un signal utile : une affirmation qui varie d’un tirage à l’autre est suspecte.
Affiner sur le corpus interne en espérant supprimer les inventions. L’affinage enseigne la forme, pas le rappel factuel fiable, et il peut même augmenter l’assurance sur des faits mal appris.
Le but n’est pas d’atteindre zéro hallucination — ce n’est pas atteignable avec cette architecture. Le but est de rendre les erreurs détectables et de dimensionner l’usage en conséquence : ancrage systématique, vérification mécanique de ce qui est vérifiable, et un humain dans la boucle partout où le coût d’une erreur dépasse le gain d’automatisation.