Objetivo: entender Query, Key, Value, multi-head attention e blocos Transformer.
A atenção permite a cada posição ponderar as informações provenientes de outras
posições. A partir de uma representação X, calcula-se:
Q = XW_Q, K = XW_K, V = XW_V
Attention(Q,K,V) = softmax(QKᵀ / √d_k) VA consulta Q descreve o que uma posição procura, as chaves K o que cada posição
propõe, os valores V a informação a agregar. A divisão por √d_k evita scores
grandes demais que saturariam o softmax.
Várias cabeças projetam os dados em subespaços diferentes, aplicam a atenção em paralelo, concatenam suas saídas e depois as reprojetam. Não há garantia de que uma cabeça corresponda a um conceito humano estável.
Pré-visualização — o resto da lição está reservado aos inscritos.
O seu acesso está ligado à sua conta, não a esta ligação. Inicie sessão com o mesmo e-mail usado na aula: o seu curso está à espera, não precisa de introduzir o código de novo.
Iniciar sessãoAinda não tem conta? Criar umaOs primeiros módulos do curso são de acesso livre. Para o resto há três possibilidades: comprar este curso de uma vez por todas, subscrever, ou introduzir o código entregue na aula.