Attention και Transformers

2 λεπτά

Στόχος: να κατανοήσετε Query, Key, Value, multi-head attention και μπλοκ Transformer.

Το attention επιτρέπει σε κάθε θέση να σταθμίζει τις πληροφορίες που προέρχονται από άλλες θέσεις. Από μια αναπαράσταση X, υπολογίζουμε:

text
Q = XW_Q,  K = XW_K,  V = XW_V
Attention(Q,K,V) = softmax(QKᵀ / √d_k) V

Το ερώτημα Q περιγράφει τι αναζητά μια θέση, τα κλειδιά K τι προτείνει κάθε θέση, οι τιμές V την πληροφορία προς συνάθροιση. Η διαίρεση με √d_k αποφεύγει πολύ μεγάλα σκορ που θα κόρευαν τη softmax.

Multi-head attention

Πολλές κεφαλές προβάλλουν τα δεδομένα σε διαφορετικούς υποχώρους, εφαρμόζουν το attention παράλληλα, συνενώνουν τις εξόδους τους και μετά τις επαναπροβάλλουν. Μια κεφαλή δεν είναι εγγυημένο ότι αντιστοιχεί σε μια σταθερή ανθρώπινη έννοια.

Προεπισκόπηση — η συνέχεια του μαθήματος είναι διαθέσιμη στους εγγεγραμμένους.

Έχετε ήδη εγγραφεί με κωδικό;

Η πρόσβασή σας συνδέεται με τον λογαριασμό σας, όχι με αυτόν τον σύνδεσμο. Συνδεθείτε με το ίδιο email που χρησιμοποιήσατε στην τάξη: το μάθημά σας σας περιμένει, δεν χρειάζεται να ξαναβάλετε τον κωδικό.

ΣύνδεσηΔεν έχετε λογαριασμό; Δημιουργήστε έναν
Αυτό το μάθημα ανήκει στην ενότητα «Ειδικές Αρχιτεκτονικές»

Οι πρώτες ενότητες του μαθήματος είναι σε ελεύθερη πρόσβαση. Για τη συνέχεια υπάρχουν τρεις δρόμοι: αγοράστε αυτό το μάθημα μία φορά, κάντε συνδρομή, ή εισαγάγετε τον κωδικό που δόθηκε στην τάξη.

Συνδρομή — 19 $ US/μήναΕπιστροφή στο πλάνο
Είστε φοιτητής σε αυτό το μάθημα;

Ο κωδικός συνδέεται με τον λογαριασμό σας: συνδεθείτε ή δημιουργήστε λογαριασμό και θα εφαρμοστεί αυτόματα όταν επιστρέψετε.

Δεν έχετε λογαριασμό; Δημιουργήστε έναν