Embeddings, tokenización y NLP

2 min

Objetivo: transformar símbolos discretos en representaciones aprendibles.

Un embedding asocia cada identificador discreto a un vector denso. Una tabla de vocabulario de tamaño V y dimensión d contiene V×d parámetros.

python
from torch import nn

embedding = nn.Embedding(num_embeddings=30_000, embedding_dim=256,
                         padding_idx=0)

Dos vectores cercanos tienen a veces usos cercanos, pero la geometría depende de la tarea y del corpus. También puede codificar los sesgos presentes en los datos.

Tokenización

La tokenización divide el texto en unidades y las convierte en identificadores. Los métodos subword limitan las palabras desconocidas combinando fragmentos. El tokenizer, su vocabulario, su normalización y sus tokens especiales forman parte integrante del modelo.

Vista previa: el resto de la lección está reservado a los inscritos.

¿Ya te inscribiste con un código?

Tu acceso está vinculado a tu cuenta, no a este enlace. Inicia sesión con el mismo correo que usaste en clase: tu curso te espera, no hace falta volver a introducir el código.

Iniciar sesión¿Aún no tienes cuenta? Crear una
Esta lección forma parte del módulo «Arquitecturas especializadas»

Los primeros módulos del curso son de acceso libre. Para el resto hay tres opciones: comprar este curso de una vez, suscribirte, o introducir el código entregado en clase.

Suscribirme — 19 $ US/mesVolver al plan
¿Eres estudiante del curso?

El código se vincula a tu cuenta: inicia sesión o crea una cuenta y se aplicará automáticamente al volver.

¿Aún no tienes cuenta? Crear una