Ensamblar un bloque Transformer y aplicar una máscara causal que impide a un token ver el futuro.
Prueba de éxito: explica «Transformer, posiciones y máscara del futuro», realiza «El triángulo de visibilidad» y cita el límite de la comparación.
Para completar una historia tarjeta tras tarjeta, Imrán construye un modelo que trata varias posiciones a la vez. Sin información de posición, la atención no recibe ninguna pista que distinga el primer lugar del cuarto; Imrán añade entonces esa pista. En un modelo generativo causal, la tarjeta número 3 solo debe consultar 1, 2 y 3. Una máscara hace inaccesibles las posiciones futuras. Después de la atención vienen conexión residual, normalización y red feed-forward.
Vista previa: el resto de la lección está reservado a los inscritos.
Tu acceso está vinculado a tu cuenta, no a este enlace. Inicia sesión con el mismo correo que usaste en clase: tu curso te espera, no hace falta volver a introducir el código.
Iniciar sesión¿Aún no tienes cuenta? Crear unaLos primeros módulos del curso son de acceso libre. Para el resto hay tres opciones: comprar este curso de una vez, suscribirte, o introducir el código entregado en clase.