الهدف: فهم السَّعَة (Capacity) والتركيب وتعلم التمثيلات.
الشبكة العميقة تُركِّب دوالّ:
f(x) = f_L(f_{L-1}(...f_2(f_1(x))))كل طبقة تُحوّل التمثيل المتلقَّى. ومع دوالّ تنشيط غير خطية، يستطيع هذا التركيب تقريب علاقات
معقّدة. أما في غياب اللاخطية، فإن عدة طبقات كثيفة تُختزل إلى تحويل تآلفي وحيد:
W3(W2(W1x)) = Wx.
لم يعد وجود سمة (Feature) مشروطاً بأن تكون عموداً مصمَّماً يدوياً. في شبكة CNN، يمكن لقناة مخفية أن تستجيب لخط قُطري؛ وأبعد في الشبكة، يمكن لتوليفة قنوات أن تستجيب لعجلة. المعنى ليس مبرمَجاً صراحةً: إنه يظهر إذا كان هذا التنظيم يُقلّل من دالة الخسارة.
متخصّص يفحص الحواف، وآخر يجمع النُّسُج، وثالث يتعرّف الأجزاء. لا يقرّر أيّ منهم بمفرده؛ تركيبهم هو الذي يُنتج القرار النهائي. في الحقيقة، «المتخصصون» مصفوفات من الأرقام تُضبَط معاً.
زيادة السَّعة تُقلّل أحياناً من نقص التكيّف (Underfitting)، لكنها ترفع الكلفة وخطر الحفظ. السؤال الصحيح هو: «أيّ سَعة تعمِّم في ظلّ قيودي؟»
على البيانات الجدولية المتوسطة الحجم، تبقى أشجار Boosting كثيراً ما تنافسية جداً. إذا كانت الإشارة ضعيفة، فإن إضافة طبقات لا تُنشئ معلومة. وإذا كانت العلامات خاطئة، فقد تتعلّم الشبكة هذه الأخطاء بكفاءة مُبهرة.
لماذا يجب وضع دالة تنشيط غير خطية بين طبقتين؟ ما الفرق بين العرض والعُمق؟ ماذا يحدث للشبكة إذا لم تحتوِ المدخلات على أيّ إشارة؟
بدون لاخطية، يبقى التركيب تآلفياً. يعُدّ العرض الوحدات في طبقة واحدة، ويعدّ العُمق الطبقات. بدون إشارة، لا تستطيع الشبكة أن تتعلّم سوى الصدفة أو التحيّزات العرضية.
ارسم نموذجَين بميزانية معاملات متشابهة: طبقة واحدة عريضة، وثلاث طبقات أضيق. صِف دالّة مركَّبة يمثّلها النموذج الثاني بشكل طبيعي، وأشِر إلى الضابط الذي يُميّز بين مكسب العُمق ومجرّد مكسب في الحوسبة.
القراءة: كل مرحلة تُحوّل التمثيل المتلقَّى وتجعل بعض العوامل أسهل فصلاً. يكون العُمق مفيداً عندما يوافق هذا التركيبُ بنيةَ المشكلة. المزلق الرئيسي هو الخلط بين «مزيد من الطبقات» و«مزيد من الجودة»: بدون بيانات وتنظيم وبروتوكول نزيه، لا تُضيف السَّعة الإضافية سوى مخاطر الإفراط في التكيّف.