Στόχος: να κατανοήσετε Query, Key, Value, multi-head attention και μπλοκ Transformer.
Το attention επιτρέπει σε κάθε θέση να σταθμίζει τις πληροφορίες που προέρχονται από άλλες
θέσεις. Από μια αναπαράσταση X, υπολογίζουμε:
Q = XW_Q, K = XW_K, V = XW_V
Attention(Q,K,V) = softmax(QKᵀ / √d_k) VΤο ερώτημα Q περιγράφει τι αναζητά μια θέση, τα κλειδιά K τι προτείνει κάθε
θέση, οι τιμές V την πληροφορία προς συνάθροιση. Η διαίρεση με √d_k αποφεύγει πολύ
μεγάλα σκορ που θα κόρευαν τη softmax.
Πολλές κεφαλές προβάλλουν τα δεδομένα σε διαφορετικούς υποχώρους, εφαρμόζουν το attention παράλληλα, συνενώνουν τις εξόδους τους και μετά τις επαναπροβάλλουν. Μια κεφαλή δεν είναι εγγυημένο ότι αντιστοιχεί σε μια σταθερή ανθρώπινη έννοια.
Προεπισκόπηση — η συνέχεια του μαθήματος είναι διαθέσιμη στους εγγεγραμμένους.
Η πρόσβασή σας συνδέεται με τον λογαριασμό σας, όχι με αυτόν τον σύνδεσμο. Συνδεθείτε με το ίδιο email που χρησιμοποιήσατε στην τάξη: το μάθημά σας σας περιμένει, δεν χρειάζεται να ξαναβάλετε τον κωδικό.
ΣύνδεσηΔεν έχετε λογαριασμό; Δημιουργήστε ένανΟι πρώτες ενότητες του μαθήματος είναι σε ελεύθερη πρόσβαση. Για τη συνέχεια υπάρχουν τρεις δρόμοι: αγοράστε αυτό το μάθημα μία φορά, κάντε συνδρομή, ή εισαγάγετε τον κωδικό που δόθηκε στην τάξη.