Gradient Descent και Optimizers

2 λεπτά

Στόχος: να ρυθμίσετε τη βελτιστοποίηση χωρίς να συγχέετε ταχύτητα μάθησης και ποιότητα.

Η κατάβαση κλίσης ενημερώνει τις παραμέτρους στην αντίθετη κατεύθυνση από την κλίση:

text
θ ← θ - η ∇L(θ)

Το η είναι ο ρυθμός μάθησης. Πολύ μικρός: αργή πρόοδος ή στασιμότητα. Πολύ μεγάλος: ταλάντωση, απόκλιση ή NaN.

Οι κύριοι βελτιστοποιητές

  • SGD: άμεση ενημέρωση· απλός και συχνά πολύ καλή γενίκευση.
  • Momentum: μεσοσταθμίζει τις πρόσφατες κατευθύνσεις και μειώνει τις ταλαντώσεις.
  • Adam: προσαρμόζει το βήμα ανά παράμετρο· αποδοτική και γρήγορη baseline.
  • AdamW: αποσυνδέει σωστά το weight decay· πολύ διαδεδομένος με Transformers.
python
optimizer = torch.optim.AdamW(model.parameters(), lr=3e-4, weight_decay=1e-2)

Προεπισκόπηση — η συνέχεια του μαθήματος είναι διαθέσιμη στους εγγεγραμμένους.

Έχετε ήδη εγγραφεί με κωδικό;

Η πρόσβασή σας συνδέεται με τον λογαριασμό σας, όχι με αυτόν τον σύνδεσμο. Συνδεθείτε με το ίδιο email που χρησιμοποιήσατε στην τάξη: το μάθημά σας σας περιμένει, δεν χρειάζεται να ξαναβάλετε τον κωδικό.

ΣύνδεσηΔεν έχετε λογαριασμό; Δημιουργήστε έναν
Αυτό το μάθημα ανήκει στην ενότητα «Αφήστε το Δίκτυο να Μάθει»

Οι πρώτες ενότητες του μαθήματος είναι σε ελεύθερη πρόσβαση. Για τη συνέχεια υπάρχουν τρεις δρόμοι: αγοράστε αυτό το μάθημα μία φορά, κάντε συνδρομή, ή εισαγάγετε τον κωδικό που δόθηκε στην τάξη.

Συνδρομή — 19 $ US/μήναΕπιστροφή στο πλάνο
Είστε φοιτητής σε αυτό το μάθημα;

Ο κωδικός συνδέεται με τον λογαριασμό σας: συνδεθείτε ή δημιουργήστε λογαριασμό και θα εφαρμοστεί αυτόματα όταν επιστρέψετε.

Δεν έχετε λογαριασμό; Δημιουργήστε έναν