Στόχος: να μετατρέψετε διακριτά σύμβολα σε μαθήσιμες αναπαραστάσεις.
Ένα embedding αντιστοιχίζει κάθε διακριτό αναγνωριστικό σε ένα πυκνό διάνυσμα. Ένας πίνακας
λεξιλογίου μεγέθους V και διάστασης d περιέχει V×d παραμέτρους.
from torch import nn
embedding = nn.Embedding(num_embeddings=30_000, embedding_dim=256,
padding_idx=0)Δύο κοντινά διανύσματα έχουν μερικές φορές κοντινές χρήσεις, αλλά η γεωμετρία εξαρτάται από την εργασία και το σώμα κειμένων. Μπορεί επίσης να κωδικοποιεί τις προκαταλήψεις που υπάρχουν στα δεδομένα.
Η tokenization τεμαχίζει το κείμενο σε μονάδες και τις μετατρέπει σε αναγνωριστικά. Οι μέθοδοι subword περιορίζουν τις άγνωστες λέξεις συνδυάζοντας θραύσματα. Ο tokenizer, το λεξιλόγιό του, η κανονικοποίησή του και τα ειδικά tokens του αποτελούν αναπόσπαστο μέρος του μοντέλου.
Προεπισκόπηση — η συνέχεια του μαθήματος είναι διαθέσιμη στους εγγεγραμμένους.
Η πρόσβασή σας συνδέεται με τον λογαριασμό σας, όχι με αυτόν τον σύνδεσμο. Συνδεθείτε με το ίδιο email που χρησιμοποιήσατε στην τάξη: το μάθημά σας σας περιμένει, δεν χρειάζεται να ξαναβάλετε τον κωδικό.
ΣύνδεσηΔεν έχετε λογαριασμό; Δημιουργήστε ένανΟι πρώτες ενότητες του μαθήματος είναι σε ελεύθερη πρόσβαση. Για τη συνέχεια υπάρχουν τρεις δρόμοι: αγοράστε αυτό το μάθημα μία φορά, κάντε συνδρομή, ή εισαγάγετε τον κωδικό που δόθηκε στην τάξη.