La première chose à faire est de séparer deux questions qu’on confond souvent, parce qu’elles n’ont pas les mêmes réponses ni les mêmes destinataires.
L’explication globale : qu’a appris le modèle, en général ? Elle sert à valider un modèle et à le confronter au savoir métier.
L’explication locale : pourquoi cette prédiction, pour ce dossier ? Elle sert à justifier une décision auprès de la personne concernée, et c’est presque toujours ce que demande un métier ou un régulateur.
Globalement :
Localement :
TreeSHAP la calcule exactement et rapidement sur les modèles à base d’arbres, ce qui couvre l’essentiel des cas tabulaires.Une contribution n’est pas une cause. SHAP explique le comportement du modèle, pas le mécanisme du monde. Si le modèle s’appuie sur une variable corrélée à la cause réelle, l’explication sera fidèle au modèle et fausse sur le fond. Confondre les deux est l’erreur la plus fréquente sur ce sujet, et savoir la nommer vaut plus que maîtriser la bibliothèque.
Un modèle interprétable par construction est parfois la meilleure réponse. Une régression logistique, un arbre court, un système de score additif : quand l’écart de performance est de deux points et que la décision doit se défendre devant un régulateur, expliquer un modèle complexe coûte plus cher qu’utiliser un modèle simple.
Et le point de contexte, à donner en dernier : en Europe, l’explication n’est pas seulement une bonne pratique. Le RGPD encadre la décision automatisée, et le règlement sur l’intelligence artificielle impose des obligations de transparence sur les usages à haut risque — crédit, emploi, santé. Pour ces cas, l’explicabilité est une contrainte de conception, pas un travail d’après-coup.