Embeddings, Tokenization και NLP

2 λεπτά

Στόχος: να μετατρέψετε διακριτά σύμβολα σε μαθήσιμες αναπαραστάσεις.

Ένα embedding αντιστοιχίζει κάθε διακριτό αναγνωριστικό σε ένα πυκνό διάνυσμα. Ένας πίνακας λεξιλογίου μεγέθους V και διάστασης d περιέχει V×d παραμέτρους.

python
from torch import nn

embedding = nn.Embedding(num_embeddings=30_000, embedding_dim=256,
                         padding_idx=0)

Δύο κοντινά διανύσματα έχουν μερικές φορές κοντινές χρήσεις, αλλά η γεωμετρία εξαρτάται από την εργασία και το σώμα κειμένων. Μπορεί επίσης να κωδικοποιεί τις προκαταλήψεις που υπάρχουν στα δεδομένα.

Tokenization

Η tokenization τεμαχίζει το κείμενο σε μονάδες και τις μετατρέπει σε αναγνωριστικά. Οι μέθοδοι subword περιορίζουν τις άγνωστες λέξεις συνδυάζοντας θραύσματα. Ο tokenizer, το λεξιλόγιό του, η κανονικοποίησή του και τα ειδικά tokens του αποτελούν αναπόσπαστο μέρος του μοντέλου.

Προεπισκόπηση — η συνέχεια του μαθήματος είναι διαθέσιμη στους εγγεγραμμένους.

Έχετε ήδη εγγραφεί με κωδικό;

Η πρόσβασή σας συνδέεται με τον λογαριασμό σας, όχι με αυτόν τον σύνδεσμο. Συνδεθείτε με το ίδιο email που χρησιμοποιήσατε στην τάξη: το μάθημά σας σας περιμένει, δεν χρειάζεται να ξαναβάλετε τον κωδικό.

ΣύνδεσηΔεν έχετε λογαριασμό; Δημιουργήστε έναν
Αυτό το μάθημα ανήκει στην ενότητα «Ειδικές Αρχιτεκτονικές»

Οι πρώτες ενότητες του μαθήματος είναι σε ελεύθερη πρόσβαση. Για τη συνέχεια υπάρχουν τρεις δρόμοι: αγοράστε αυτό το μάθημα μία φορά, κάντε συνδρομή, ή εισαγάγετε τον κωδικό που δόθηκε στην τάξη.

Συνδρομή — 19 $ US/μήναΕπιστροφή στο πλάνο
Είστε φοιτητής σε αυτό το μάθημα;

Ο κωδικός συνδέεται με τον λογαριασμό σας: συνδεθείτε ή δημιουργήστε λογαριασμό και θα εφαρμοστεί αυτόματα όταν επιστρέψετε.

Δεν έχετε λογαριασμό; Δημιουργήστε έναν