الهدف: ضبط التحسين دون الخلط بين سرعة التعلم وجودة النموذج.
يُحدِّث الانحدار التدريجي المعاملات في الاتجاه المعاكس للتدرج:
θ ← θ - η ∇L(θ)η هو معدّل التعلم (Learning rate). إذا كان صغيراً جداً: تقدّم بطيء أو ركود. إذا كان
كبيراً جداً: تذبذب، أو تباعُد، أو NaN.
weight decay بشكل صحيح؛ يُستعمل كثيراً مع المحوّلات (Transformers).optimizer = torch.optim.AdamW(model.parameters(), lr=3e-4, weight_decay=1e-2)معاينة — بقية الدرس متاحة للمسجّلين فقط.
وصولك مرتبط بحسابك وليس بهذا الرابط. سجّل الدخول بنفس البريد الذي استخدمته في الصف: دورتك بانتظارك، ولا حاجة لإدخال الرمز مجددًا.
تسجيل الدخولليس لديك حساب بعد؟ أنشئ حسابًاالوحدات الأولى من الدورة مفتوحة للجميع. أما البقية فأمامك ثلاثة خيارات: شراء هذه الدورة مرة واحدة، أو الاشتراك، أو إدخال الرمز الموزّع في القاعة.