Assembler un bloc Transformer et appliquer un masque causal empêchant un token de voir le futur.
Preuve de réussite : explique « Transformer, positions et masque du futur », réalise « Le triangle de visibilité » et cite la limite de l’analogie.
Pour compléter une histoire carte après carte, Imran construit un modèle qui traite plusieurs positions ensemble. Sans information de position, l'attention ne reçoit aucun indice distinguant la première place de la quatrième ; Imran ajoute donc cet indice. Dans un modèle génératif causal, la carte numéro 3 ne doit consulter que 1, 2 et 3. Un masque rend les positions futures inaccessibles. Après attention viennent connexion résiduelle, normalisation et réseau feed-forward.
Aperçu — la suite de la leçon est réservée aux inscrits.
Votre accès est rattaché à votre compte, pas à ce lien. Connectez-vous avec le même courriel qu'en classe : votre cours vous attend, inutile de ré-entrer le code.
Se connecterPas encore de compte ? En créer unLes premiers modules du cours sont en accès libre. Pour la suite, trois possibilités : acheter ce cours une fois pour toutes, vous abonner pour tout ouvrir, ou entrer le code si vous suivez le cours en classe.