Atenção e Transformers

2 min

Objetivo: entender Query, Key, Value, multi-head attention e blocos Transformer.

A atenção permite a cada posição ponderar as informações provenientes de outras posições. A partir de uma representação X, calcula-se:

text
Q = XW_Q,  K = XW_K,  V = XW_V
Attention(Q,K,V) = softmax(QKᵀ / √d_k) V

A consulta Q descreve o que uma posição procura, as chaves K o que cada posição propõe, os valores V a informação a agregar. A divisão por √d_k evita scores grandes demais que saturariam o softmax.

Multi-head attention

Várias cabeças projetam os dados em subespaços diferentes, aplicam a atenção em paralelo, concatenam suas saídas e depois as reprojetam. Não há garantia de que uma cabeça corresponda a um conceito humano estável.

Pré-visualização — o resto da lição está reservado aos inscritos.

Já se inscreveu com um código?

O seu acesso está ligado à sua conta, não a esta ligação. Inicie sessão com o mesmo e-mail usado na aula: o seu curso está à espera, não precisa de introduzir o código de novo.

Iniciar sessãoAinda não tem conta? Criar uma
Esta lição faz parte do módulo «Arquiteturas especializadas»

Os primeiros módulos do curso são de acesso livre. Para o resto há três possibilidades: comprar este curso de uma vez por todas, subscrever, ou introduzir o código entregue na aula.

Subscrever — 19 $ US/mêsVoltar ao plano
É estudante do curso?

O código fica ligado à sua conta: inicie sessão ou crie uma conta e ele será aplicado automaticamente ao regressar.

Ainda não tem conta? Criar uma