Comment expliquez-vous la décision d’un modèle ?

Questions d’entrevue Apprentissage supervisé

Seniorinterpretabiliteshapproduction

La première chose à faire est de séparer deux questions qu’on confond souvent, parce qu’elles n’ont pas les mêmes réponses ni les mêmes destinataires.

L’explication globale : qu’a appris le modèle, en général ? Elle sert à valider un modèle et à le confronter au savoir métier.

L’explication locale : pourquoi cette prédiction, pour ce dossier ? Elle sert à justifier une décision auprès de la personne concernée, et c’est presque toujours ce que demande un métier ou un régulateur.

Les outils, par question

Globalement :

  • L’importance par permutation. On mélange une colonne et on mesure ce que le score perd. Agnostique au modèle, mesurée sur la validation, et fidèle à l’apport réel en généralisation. À préférer à l’importance par impureté, biaisée en faveur des variables à nombreuses modalités.
  • Les graphiques de dépendance partielle, qui montrent la forme du lien entre une variable et la prédiction. Utiles pour vérifier une monotonie qu’on attend — le risque doit croître avec l’endettement — et trompeurs quand les variables sont corrélées, cas où les courbes ALE sont plus honnêtes.

Localement :

  • SHAP, qui répartit l’écart entre la prédiction et la moyenne des prédictions en une contribution par variable. Sa propriété d’additivité est ce qui le rend défendable : les contributions se somment exactement à la prédiction, donc l’explication est complète. TreeSHAP la calcule exactement et rapidement sur les modèles à base d’arbres, ce qui couvre l’essentiel des cas tabulaires.
  • LIME, qui ajuste un modèle simple autour du point. Plus rapide, moins stable — deux exécutions peuvent donner deux explications, ce qui est difficile à défendre devant un client.
  • Les explications contrefactuelles, souvent les plus utiles au destinataire : « ce prêt aurait été accordé avec un apport supérieur de 4 000 euros ». Elles disent quoi changer, ce qu’une liste de contributions ne dit pas.

Les précautions à énoncer

Une contribution n’est pas une cause. SHAP explique le comportement du modèle, pas le mécanisme du monde. Si le modèle s’appuie sur une variable corrélée à la cause réelle, l’explication sera fidèle au modèle et fausse sur le fond. Confondre les deux est l’erreur la plus fréquente sur ce sujet, et savoir la nommer vaut plus que maîtriser la bibliothèque.

Un modèle interprétable par construction est parfois la meilleure réponse. Une régression logistique, un arbre court, un système de score additif : quand l’écart de performance est de deux points et que la décision doit se défendre devant un régulateur, expliquer un modèle complexe coûte plus cher qu’utiliser un modèle simple.

Et le point de contexte, à donner en dernier : en Europe, l’explication n’est pas seulement une bonne pratique. Le RGPD encadre la décision automatisée, et le règlement sur l’intelligence artificielle impose des obligations de transparence sur les usages à haut risque — crédit, emploi, santé. Pour ces cas, l’explicabilité est une contrainte de conception, pas un travail d’après-coup.

Toutes les questions Apprentissage supervisé