Atención y Transformers

2 min

Objetivo: entender Query, Key, Value, multi-head attention y bloques Transformer.

La atención permite a cada posición ponderar la información procedente de otras posiciones. A partir de una representación X, se calcula:

text
Q = XW_Q,  K = XW_K,  V = XW_V
Attention(Q,K,V) = softmax(QKᵀ / √d_k) V

La consulta Q describe lo que busca una posición, las claves K lo que cada posición propone, los valores V la información a agregar. La división por √d_k evita puntuaciones demasiado grandes que saturarían el softmax.

Multi-head attention

Varias cabezas proyectan los datos en subespacios diferentes, aplican la atención en paralelo, concatenan sus salidas y luego las reproyectan. No está garantizado que una cabeza corresponda a un concepto humano estable.

Vista previa: el resto de la lección está reservado a los inscritos.

¿Ya te inscribiste con un código?

Tu acceso está vinculado a tu cuenta, no a este enlace. Inicia sesión con el mismo correo que usaste en clase: tu curso te espera, no hace falta volver a introducir el código.

Iniciar sesión¿Aún no tienes cuenta? Crear una
Esta lección forma parte del módulo «Arquitecturas especializadas»

Los primeros módulos del curso son de acceso libre. Para el resto hay tres opciones: comprar este curso de una vez, suscribirte, o introducir el código entregado en clase.

Suscribirme — 19 $ US/mesVolver al plan
¿Eres estudiante del curso?

El código se vincula a tu cuenta: inicia sesión o crea una cuenta y se aplicará automáticamente al volver.

¿Aún no tienes cuenta? Crear una