Embeddings, tokenisation et NLP

2 min

Objectif : transformer des symboles discrets en représentations apprenables.

Un embedding associe chaque identifiant discret à un vecteur dense. Une table de vocabulaire de taille V et dimension d contient V×d paramètres.

python
from torch import nn

embedding = nn.Embedding(num_embeddings=30_000, embedding_dim=256,
                         padding_idx=0)

Deux vecteurs proches ont parfois des usages proches, mais la géométrie dépend de la tâche et du corpus. Elle peut aussi encoder les biais présents dans les données.

Tokenisation

La tokenisation découpe le texte en unités et les convertit en identifiants. Les méthodes subword limitent les mots inconnus en combinant des fragments. Le tokenizer, son vocabulaire, sa normalisation et ses tokens spéciaux font partie intégrante du modèle.

Aperçu — la suite de la leçon est réservée aux inscrits.

Déjà inscrit avec un code ?

Votre accès est rattaché à votre compte, pas à ce lien. Connectez-vous avec le même courriel qu'en classe : votre cours vous attend, inutile de ré-entrer le code.

Se connecterPas encore de compte ? En créer un
Cette leçon fait partie du module « Architectures spécialisées »

Les premiers modules du cours sont en accès libre. Pour la suite, trois possibilités : acheter ce cours une fois pour toutes, vous abonner pour tout ouvrir, ou entrer le code si vous suivez le cours en classe.

M’abonner — 19 $ US/moisRetour au plan
Vous êtes étudiant du cours ?

Le code se rattache à votre compte : connectez-vous ou créez un compte, il sera validé automatiquement au retour.

Pas encore de compte ? En créer un