Objetivo: transformar símbolos discretos en representaciones aprendibles.
Un embedding asocia cada identificador discreto a un vector denso. Una tabla de
vocabulario de tamaño V y dimensión d contiene V×d parámetros.
from torch import nn
embedding = nn.Embedding(num_embeddings=30_000, embedding_dim=256,
padding_idx=0)Dos vectores cercanos tienen a veces usos cercanos, pero la geometría depende de la tarea y del corpus. También puede codificar los sesgos presentes en los datos.
La tokenización divide el texto en unidades y las convierte en identificadores. Los métodos subword limitan las palabras desconocidas combinando fragmentos. El tokenizer, su vocabulario, su normalización y sus tokens especiales forman parte integrante del modelo.
Vista previa: el resto de la lección está reservado a los inscritos.
Tu acceso está vinculado a tu cuenta, no a este enlace. Inicia sesión con el mismo correo que usaste en clase: tu curso te espera, no hace falta volver a introducir el código.
Iniciar sesión¿Aún no tienes cuenta? Crear unaLos primeros módulos del curso son de acceso libre. Para el resto hay tres opciones: comprar este curso de una vez, suscribirte, o introducir el código entregado en clase.