Attention et Transformers

2 min

Objectif : comprendre Query, Key, Value, multi-head attention et blocs Transformer.

L'attention permet à chaque position de pondérer les informations provenant d'autres positions. À partir d'une représentation X, on calcule :

text
Q = XW_Q,  K = XW_K,  V = XW_V
Attention(Q,K,V) = softmax(QKᵀ / √d_k) V

La requête Q décrit ce que cherche une position, les clés K ce que chaque position propose, les valeurs V l'information à agréger. La division par √d_k évite des scores trop grands qui satureraient softmax.

Multi-head attention

Plusieurs têtes projettent les données dans des sous-espaces différents, appliquent l'attention en parallèle, concatènent leurs sorties puis les reprojettent. Une tête n'est pas garantie de correspondre à un concept humain stable.

Aperçu — la suite de la leçon est réservée aux inscrits.

Déjà inscrit avec un code ?

Votre accès est rattaché à votre compte, pas à ce lien. Connectez-vous avec le même courriel qu'en classe : votre cours vous attend, inutile de ré-entrer le code.

Se connecterPas encore de compte ? En créer un
Cette leçon fait partie du module « Architectures spécialisées »

Les premiers modules du cours sont en accès libre. Pour la suite, trois possibilités : acheter ce cours une fois pour toutes, vous abonner pour tout ouvrir, ou entrer le code si vous suivez le cours en classe.

M’abonner — 19 $ US/moisRetour au plan
Vous êtes étudiant du cours ?

Le code se rattache à votre compte : connectez-vous ou créez un compte, il sera validé automatiquement au retour.

Pas encore de compte ? En créer un