Gradient και Backpropagation

2 λεπτά

Στόχος: να κατανοήσετε πώς ένα τελικό σφάλμα γίνεται μια τοπική διόρθωση.

Η κλίση συγκεντρώνει τις παραγώγους της απώλειας ως προς τις παραμέτρους. Η συνιστώσα της ∂L/∂w_i δείχνει πώς μια μικρή αύξηση του βάρους w_i θα μετέβαλλε την απώλεια.

Ο κανόνας της αλυσίδας

Αν το L εξαρτάται από το a, που εξαρτάται από το z, που εξαρτάται από το w:

text
∂L/∂w = ∂L/∂a × ∂a/∂z × ∂z/∂w

Η οπισθοδιάδοση εφαρμόζει αποδοτικά αυτόν τον κανόνα από την απώλεια προς κάθε παράμετρο του γράφου. Δεν αποτελεί τον βελτιστοποιητή: υπολογίζει τις κλίσεις· ο βελτιστοποιητής αποφασίζει στη συνέχεια την ενημέρωση.

python
optimizer.zero_grad()  # διαγραφή των προηγούμενων κλίσεων
logits = model(x)
loss = criterion(logits, y)
loss.backward()        # υπολογισμός των κλίσεων
optimizer.step()       # τροποποίηση των παραμέτρων

Προεπισκόπηση — η συνέχεια του μαθήματος είναι διαθέσιμη στους εγγεγραμμένους.

Έχετε ήδη εγγραφεί με κωδικό;

Η πρόσβασή σας συνδέεται με τον λογαριασμό σας, όχι με αυτόν τον σύνδεσμο. Συνδεθείτε με το ίδιο email που χρησιμοποιήσατε στην τάξη: το μάθημά σας σας περιμένει, δεν χρειάζεται να ξαναβάλετε τον κωδικό.

ΣύνδεσηΔεν έχετε λογαριασμό; Δημιουργήστε έναν
Αυτό το μάθημα ανήκει στην ενότητα «Αφήστε το Δίκτυο να Μάθει»

Οι πρώτες ενότητες του μαθήματος είναι σε ελεύθερη πρόσβαση. Για τη συνέχεια υπάρχουν τρεις δρόμοι: αγοράστε αυτό το μάθημα μία φορά, κάντε συνδρομή, ή εισαγάγετε τον κωδικό που δόθηκε στην τάξη.

Συνδρομή — 19 $ US/μήναΕπιστροφή στο πλάνο
Είστε φοιτητής σε αυτό το μάθημα;

Ο κωδικός συνδέεται με τον λογαριασμό σας: συνδεθείτε ή δημιουργήστε λογαριασμό και θα εφαρμοστεί αυτόματα όταν επιστρέψετε.

Δεν έχετε λογαριασμό; Δημιουργήστε έναν