Embeddings, tokenização e PLN

2 min

Objetivo: transformar símbolos discretos em representações aprendíveis.

Um embedding associa cada identificador discreto a um vetor denso. Uma tabela de vocabulário de tamanho V e dimensão d contém V×d parâmetros.

python
from torch import nn

embedding = nn.Embedding(num_embeddings=30_000, embedding_dim=256,
                         padding_idx=0)

Dois vetores próximos às vezes têm usos próximos, mas a geometria depende da tarefa e do corpus. Ela também pode codificar os vieses presentes nos dados.

Tokenização

A tokenização recorta o texto em unidades e as converte em identificadores. Os métodos subword limitam as palavras desconhecidas combinando fragmentos. O tokenizer, seu vocabulário, sua normalização e seus tokens especiais fazem parte integrante do modelo.

Pré-visualização — o resto da lição está reservado aos inscritos.

Já se inscreveu com um código?

O seu acesso está ligado à sua conta, não a esta ligação. Inicie sessão com o mesmo e-mail usado na aula: o seu curso está à espera, não precisa de introduzir o código de novo.

Iniciar sessãoAinda não tem conta? Criar uma
Esta lição faz parte do módulo «Arquiteturas especializadas»

Os primeiros módulos do curso são de acesso livre. Para o resto há três possibilidades: comprar este curso de uma vez por todas, subscrever, ou introduzir o código entregue na aula.

Subscrever — 19 $ US/mêsVoltar ao plano
É estudante do curso?

O código fica ligado à sua conta: inicie sessão ou crie uma conta e ele será aplicado automaticamente ao regressar.

Ainda não tem conta? Criar uma