Objetivo: entender Query, Key, Value, multi-head attention y bloques Transformer.
La atención permite a cada posición ponderar la información procedente de otras
posiciones. A partir de una representación X, se calcula:
Q = XW_Q, K = XW_K, V = XW_V
Attention(Q,K,V) = softmax(QKᵀ / √d_k) VLa consulta Q describe lo que busca una posición, las claves K lo que cada posición
propone, los valores V la información a agregar. La división por √d_k evita puntuaciones
demasiado grandes que saturarían el softmax.
Varias cabezas proyectan los datos en subespacios diferentes, aplican la atención en paralelo, concatenan sus salidas y luego las reproyectan. No está garantizado que una cabeza corresponda a un concepto humano estable.
Vista previa: el resto de la lección está reservado a los inscritos.
Tu acceso está vinculado a tu cuenta, no a este enlace. Inicia sesión con el mismo correo que usaste en clase: tu curso te espera, no hace falta volver a introducir el código.
Iniciar sesión¿Aún no tienes cuenta? Crear unaLos primeros módulos del curso son de acceso libre. Para el resto hay tres opciones: comprar este curso de una vez, suscribirte, o introducir el código entregado en clase.