Objetivo: transformar símbolos discretos em representações aprendíveis.
Um embedding associa cada identificador discreto a um vetor denso. Uma tabela de
vocabulário de tamanho V e dimensão d contém V×d parâmetros.
from torch import nn
embedding = nn.Embedding(num_embeddings=30_000, embedding_dim=256,
padding_idx=0)Dois vetores próximos às vezes têm usos próximos, mas a geometria depende da tarefa e do corpus. Ela também pode codificar os vieses presentes nos dados.
A tokenização recorta o texto em unidades e as converte em identificadores. Os métodos subword limitam as palavras desconhecidas combinando fragmentos. O tokenizer, seu vocabulário, sua normalização e seus tokens especiais fazem parte integrante do modelo.
Pré-visualização — o resto da lição está reservado aos inscritos.
O seu acesso está ligado à sua conta, não a esta ligação. Inicie sessão com o mesmo e-mail usado na aula: o seu curso está à espera, não precisa de introduzir o código de novo.
Iniciar sessãoAinda não tem conta? Criar umaOs primeiros módulos do curso são de acesso livre. Para o resto há três possibilidades: comprar este curso de uma vez por todas, subscrever, ou introduzir o código entregue na aula.