الانحدار التدريجي والمحسِّنات

2 دقيقة

الهدف: ضبط التحسين دون الخلط بين سرعة التعلم وجودة النموذج.

يُحدِّث الانحدار التدريجي المعاملات في الاتجاه المعاكس للتدرج:

text
θ ← θ - η ∇L(θ)

η هو معدّل التعلم (Learning rate). إذا كان صغيراً جداً: تقدّم بطيء أو ركود. إذا كان كبيراً جداً: تذبذب، أو تباعُد، أو NaN.

أهمّ المحسِّنات

  • SGD: تحديث مباشر؛ بسيط، وكثيراً ما يُنتج تعميماً جيداً جداً.
  • Momentum: يُحسِّب متوسّط الاتجاهات الأخيرة ويُخفِّف التذبذبات.
  • Adam: يُكيّف الخطوة لكل معامل؛ خط أساس فعّال وسريع.
  • AdamW: يفصل weight decay بشكل صحيح؛ يُستعمل كثيراً مع المحوّلات (Transformers).
python
optimizer = torch.optim.AdamW(model.parameters(), lr=3e-4, weight_decay=1e-2)

معاينة — بقية الدرس متاحة للمسجّلين فقط.

هل سجّلت من قبل برمز؟

وصولك مرتبط بحسابك وليس بهذا الرابط. سجّل الدخول بنفس البريد الذي استخدمته في الصف: دورتك بانتظارك، ولا حاجة لإدخال الرمز مجددًا.

تسجيل الدخولليس لديك حساب بعد؟ أنشئ حسابًا
هذا الدرس جزء من وحدة «تعليم الشبكة»

الوحدات الأولى من الدورة مفتوحة للجميع. أما البقية فأمامك ثلاثة خيارات: شراء هذه الدورة مرة واحدة، أو الاشتراك، أو إدخال الرمز الموزّع في القاعة.

هل أنت طالب في هذه الدورة؟

يرتبط الرمز بحسابك: سجّل الدخول أو أنشئ حسابًا وسيُطبَّق تلقائيًا عند عودتك.

ليس لديك حساب بعد؟ أنشئ حسابًا