المعاملات والمعاملات الفائقة

31 دقيقة
الكتلة 1 — المفردات الأساسية
الهدف
القدرة على تمييز ما يتعلّمه نموذج عما يفرضه مهندس بلا تردد، وتسمية المعاملات الفائقة المعتادة لكل عائلة خوارزميات وأثر كل منها، والتحقّق من هذا التمييز في الشفرة، وامتلاك مفردات التقييم التي ستُعمَّق في الكتل التالية: خسارة، مقياس، درجة، عتبة، مرجع ساذج.
المدة المقدَّرة
45 دقيقة
المتطلبات السابقة
الفصول 001 إلى 008
الاختبارات المرتبطة
من 009.1-quiz-parametre-appris.md إلى 009.7-quiz-loss-metric-score-seuil-baseline.md

1. فئتان من الأعداد في نموذج

النموذج المدرَّب كائن عددي: إنه يتضمّن أعداداً. وهذه الأعداد ليست كلها من الطبيعة نفسها، وخلطها من أكثر الأخطاء شيوعاً في بداية الممارسة.

الفئةالأصلتُثبَّت متىمن يقرر
معامل (parameter)تحسبه إجراء الأمثلةأثناء التدريبالخوارزمية، انطلاقاً من البيانات
معامل فائق (hyperparameter)يُرصَد قبل إطلاق التدريبقبل التدريبالمهندس، أو إجراء بحث

ميّز الفصل 008 الخوارزمية، وهي إجراء، عن النموذج، وهو نتيجة تطبيقها على مجموعة بيانات. وتضبط المعاملات الفائقة الإجراء؛ وتشكّل المعاملات النتيجة.

قراءة المخطط: تظهر المعاملات الفائقة في النموذج النهائي بمقام المعاملات نفسه، إذ تصف تكوينه، لكنها تصل إليه بمسار مختلف: لم تمر أبداً بإجراء الأمثلة.

تشبيه — الوصفة وضبط الفرن والعجين والكعكة

تتدخل أربعة كائنات متميّزة في صنع كعكة، وهي تقابل حداً بحد كائنات التعلّم الآلي الأربعة.

الوصفة هي سلسلة العمليات الواجب إجراؤها: خلط، دمج، إدخال الفرن، إراحة. وهي توجد بمعزل عن أي كعكة خاصة. هذه هي الخوارزمية.

الضبطات قرارات تُتَّخذ قبل إدخال الفرن: فرن عند 180 °C، طهي 35 دقيقة، حجم القالب. يثبّتها الحلواني مسبقاً؛ ولا يُكتشَف أي منها أثناء الطهي، وكلها تشترطه. هذه هي المعاملات الفائقة.

ما يصبح عليه العجين أثناء الطهي — بنية اللب، تلوين القشرة، توزيع الرطوبة — لا يقرره أحد: إنه ينتج عن تفاعل المكوّنات والضبطات. هذه هي المعاملات المتعلَّمة.

الكعكة الخارجة من الفرن هي الكائن النهائي المحصَّل بتطبيق هذه الوصفة على هذه المكوّنات بهذه الضبطات. هذا هو النموذج.

ثلاث نتائج تُقرَأ مباشرة في التشبيه. فالمكوّنات نفسها والوصفة نفسها تعطي كعكات مختلفة حسب الضبطات: ومن هنا تحسين المعاملات الفائقة، المعالَج في الفصل 035. ولا توجد حرارة صحيحة عالمياً، بل حرارة ملائمة لكعكة وفرن: ولا يوجد كذلك max_depth أمثل في ذاته. وأخيراً، لا تُحدَّد الحرارة الجيدة بتقديم الكعكة لهيئة المسابقة ثم البدء من جديد: تتذوق الهيئة مرة واحدة، والتجارب تتم على دفعات تجريبية. وهذا وضع مجموعة الاختبار، المطوَّر في الفقرة 6.

حد التشبيه: يمكن للحلواني فتح الفرن ورصد الطهي. أما تكوين المعاملات فليس قابلاً للرصد خطوة بخطوة بصورة قابلة للتفسير. ويصف التشبيه الأدوار، لا شفافية العملية.


2. المعامل: ما يضبطه إجراء الأمثلة

تعريف — معامل نموذج (model parameter)

التعريف الدقيق

مقدار داخلي لنموذج تُحدَّد قيمته بإجراء الأمثلة المطبق على بيانات التدريب، بهدف تقليل دالة هدف معرَّفة على هذه البيانات. ومجموعة المعاملات، المرمَّزة عادة θ، تحدّد دالة خاصة تحديداً أحادياً داخل عائلة الدوال التي تستطيع الخوارزمية تمثيلها.

الصياغة المجموعية

تعرّف الخوارزمية عائلة دوال مرشَّحة، تُدعى فضاء الفرضيات ويُرمَّز H. ويقوم التدريب على انتقاء عنصر h ∈ H. والمعاملات إحداثيات هذا العنصر في H.

ترجمة إلى اللغة اليومية

هذه الأعداد التي حسبها النموذج نفسه انطلاقاً من البيانات، و تشكّل جوهر ما احتفظ به. وهي التي ستُكتَب في ملف النموذج وتُحمَّل لحظة التنبؤ.

نقطة انتباه

لا معنى لمعامل إلا نسبة إلى مجموعة البيانات التي أنتجته. وإعادة تدريب الخوارزمية نفسها على عيّنة أخرى تنتج معاملات أخرى. فمعامل ليس إذن ثابتاً فيزيائياً: إنه تقدير، مصحوب بعدم يقين معاينة.

2.1 النماذج الخطية: المعاملات والثابت

ينمذج الانحدار الخطي المتعدد الهدف كتركيب تآلفي للمتغيرات التوضيحية:

ŷ = b₀ + b₁·x₁ + b₂·x₂ + ... + b_p·x_p

والمعاملات المتعلَّمة هي المعاملات p من b₁ إلى bpb_p والثابت b₀، أي p + 1 قيمة. ولا يُحفَظ أي مقدار آخر.

مثال رقمي — تقدير سعر مسكن

المتغيرالمعامل المتعلَّمالتفسير
ثابت (b₀)42 300سعر أساس بالدولار، كل المتغيرات معدومة
مساحة سكنية (م²)2 180كل م² إضافي يضيف 2 180 $
عدد الغرف6 400كل غرفة إضافية تضيف 6 400 $
عُمر العقار (سنوات)−870كل سنة أقدمية تسحب 870 $
المسافة إلى المركز (كم)−3 150كل كم إضافي يسحب 3 150 $

النموذج كله في هذه الأعداد الخمسة. لمسكن 85 م²، ثلاث غرف، اثنتا عشرة سنة، أربعة كيلومترات من المركز: ŷ = 42 300 + 2 180×85 + 6 400×3 − 870×12 − 3 150×4 = 224 570 $.

نقطة انتباه: شرط «كل الأشياء الأخرى متساوية» يفترض أن المتغيرات يمكن أن تتغيّر مستقلة بعضها عن بعض، وهي فرضية نادراً ما تتحقّق. والتعدد الخطي معالَج في الفصل 045.

وفي الانحدار اللوجستي، البنية مطابقة، إذ يُحوَّل التركيب الخطي بدالة سيغمودية لإنتاج احتمال. وتبقى المعاملات المعاملات والثابت (الفصل 036).

2.2 الشبكات العصبية: الأوزان والانحيازات

تعريف — أوزان وانحيازات شبكة عصبية

التعريف الدقيق

في بيرسبترون متعدد الطبقات، يحسب كل عصبون في طبقة مجموعاً مرجَّحاً لمخارج الطبقة السابقة، مزيداً بحد ثابت، ثم يطبق دالة تنشيط غير خطية. ومعاملات المجموع المرجَّح هي الأوزان (weights)، والحد الثابت هو الانحياز (bias). والأوزان والانحيازات تشكّل كامل المعاملات المتعلَّمة للشبكة.

العدّ

لطبقة تستقبل m مدخلاً وتتضمّن n عصبوناً، عدد المعاملات هو m × n وزناً زائداً n انحيازاً.

ترجمة إلى اللغة اليومية

كل اتصال بين عصبونين يحمل عدداً، يقول الأهمية الممنوحة لما ينقله الاتصال. وكل عصبون يحمل إضافة عدداً يزيح عتبة إطلاقه.

نقطة انتباه اصطلاحية

لكلمة «انحياز» هنا معنى تقني صرف: إنه الحد الثابت لتحويل تآلفي. ولا يجب خلطه بالتحيز الإحصائي لموازنة التحيز–التباين (الفصل 032)، ولا بالتحيز المجتمعي لنموذج تمييزي (الفصل 080). ثلاثة مفاهيم متجانسة اللفظ، ثلاثة تعريفات منفصلة.

مثال رقمي — بيرسبترون متعدد الطبقات لدرجة انقطاع

العمارة: 20 متغيراً في المدخل، طبقتان خفيتان 64 ثم 32 عصبوناً، مخرج واحد.

الانتقالأوزانانحيازاتالمجموع
مدخل → طبقة 120 × 64 = 1 280641 344
طبقة 1 → طبقة 264 × 32 = 2 048322 080
طبقة 2 → مخرج32 × 1 = 32133
المجموع3 360973 457

تتعلّم هذه الشبكة 3 457 عدداً. وعدد الطبقات وحجمها — أي hidden_layer_sizes=(64, 32) — ليسا متعلَّمين: إنهما معاملان فائقان، وهما اللذان يحددان عدد المعاملات الواجب تعلّمها. فمعامل فائق يحكم إذن كمية المعاملات، وهو ما يشكّل الرابط المباشر مع مفهوم القدرة، المعالَج في الفقرة 7.

2.3 أشجار القرار: البنية ومتغيرات التقسيم والعتبات

ليس لشجرة قرار معامل ولا وزن. وما تتعلّمه ذو طبيعة تركيبية:

  • لكل عقدة داخلية، المتغير الذي يُقسَم عليه؛
  • لكل عقدة داخلية، عتبة التقسيم على هذا المتغير؛
  • طوبولوجيا الشجرة، أي أي عقد تُقسَم وأيها تصبح أوراقاً؛
  • لكل ورقة، القيمة المتنبَّأ بها أو توزيع الفئات.

رؤية جزئية: المستويات الثلاثة الأولى للشجرة المحصَّلة فعلاً في الفقرة 5.3، اختُصرت منها شعبتان.

القيمة 32,50 لم يخترها محلّل: قيّمت الخوارزمية التقسيمات المرشَّحة على كل متغير واحتفظت بالذي يقلّل أكثر عدم نقاء العقدة. وهي متعلَّمة، بمقام معامل انحدار (الآلية مفصَّلة في الفصل 037). وما ثبّته المهندس هو إطار هذا البحث: عمق أقصى، عدد أدنى لورقة، معيار عدم نقاء.

2.4 آلات المتجهات الداعمة

تعريف — المتجهات الداعمة (support vectors)

التعريف الدقيق

في الصياغة الثنائية لآلة متجهات داعمة (Boser، Guyon و Vapnik، 1992؛ Cortes وVapnik، 1995)، يُعبَّر عن الحل كتركيب خطي لدوال نواة مقيَّمة على مجموعة جزئية من ملاحظات التدريب. والملاحظات التي معاملها الثنائي αi\alpha_i موجب صرفاً تُدعى متجهات داعمة: إنها الوحيدة التي تتدخل في دالة القرار.

ما يُتعلَّم

المعاملات الثنائية αi\alpha_i، وهوية الملاحظات المحتفَظ بها كمتجهات داعمة، وثابت القرار. ومع نواة خطية، تُعاد تركيب هذه الكميات في متجه معاملات متجانس مع ذلك لنموذج خطي.

ترجمة إلى اللغة اليومية

يحتفظ النموذج بأمثلة التدريب الواقعة قرب الحد بين الفئات ويسند إليها وزناً؛ والأمثلة البعيدة لا تؤثّر في القرار.

نقطة انتباه

عدد المتجهات الداعمة نتيجة للتدريب، لا تعليمات أبداً. وعدد قريب من عدد التدريب يشير إلى حد شديد عدم الانتظام وخطر فرط تخصيص، غالباً مرتبط بـ gamma كبير جداً (الفصل 041).

2.5 حالة الطرائق القائمة على الحفظ

تعريف — طريقة غير وسيطية وتعلّم كسول

التعريف الدقيق

تُدعى طريقة غير وسيطية عندما لا يُحدَّ تعقيد الدالة المتعلَّمة بعدد معاملات ثابت مسبقاً، بل ينمو مع عدد بيانات التدريب. وتُدعى طريقة كسولة (lazy learning) عندما تؤجّل كل حساب تعميم إلى طلب التنبؤ.

التطبيق على أقرب k جيران

استدعاء fit() على KNeighborsClassifier لا يحسب أي معامل: إنه يحفظ مجموعة التدريب ويبني أحياناً بنية فهرسة. وما «يُتعلَّم» هو مجموعة البيانات نفسها: النموذج لا يلخّص شيئاً، إنه يقارن الملاحظة الجديدة بالأمثلة المحتفَظ بها لحظة الإجابة.

نقطة انتباه

غير وسيطي لا يعني «بلا معامل فائق». فعدد الجيران k ومترية المسافة والترجيح حاسمة (الفصل 040).

2.6 أوامر الحجم

النموذجطبيعة المعاملات المتعلَّمةالعدد لحالة نموذجية
انحدار خطي، 20 متغيراًمعاملات + ثابت21
انحدار لوجستي ثنائي، 50 متغيراًمعاملات + ثابت51
انحدار لوجستي، 10 فئات، 100 متغيرمصفوفة معاملات + ثوابت1 010
شجرة قرار، max_depth=3متغيرات، عتبات، قيم أوراق15 عقدة منها 8 أوراق
شجرة قرار، max_depth=10كذلك757 عقدة منها 379 ورقة
غابة عشوائية، 300 شجرة، max_depth=6كذلك، مجمَّع على 300 شجرةنحو 35 000 عقدة
بيرسبترون متعدد الطبقات (20، 64، 32، 1)أوزان وانحيازات3 457
SVM بنواة RBF، 4 000 ملاحظةمتجهات داعمة ومعاملات ثنائيةبضع مئات إلى بضعة آلاف
أقرب k جيران، 4 000 ملاحظةمجموعة التدريب المحفوظة4 000 ملاحظة محتفَظ بها

تستأنف صفوف «شجرة» و«غابة» القيم المقيسة في الفقرة 5. وهي توضّح واقعة مركزية: عدد المعاملات المتعلَّمة ليس خاصية للخوارزمية وحدها، إنه محدَّد معاً بالمعاملات الفائقة والبيانات.


3. المعامل الفائق: ما يثبّته المهندس قبل الأمثلة

تعريف — المعامل الفائق (hyperparameter)

التعريف الدقيق

مقدار يضبط خوارزمية التعلّم، تُثبَّت قيمته مسبقاً لتنفيذ إجراء الأمثلة ولا تعدّلها هذه. وتحدد المعاملات الفائقة فضاء الفرضيات المستكشَف، ودالة الهدف المقلَّلة فعلاً، والإجراء العددي المستعمَل و معيار توقفه.

الصياغة التشغيلية

معامل فائق متغير يجب أن تُعرَف قيمته حتى يتمكن التدريب من البدء، وقيمته لا تتغيّر عندما ينتهي التدريب.

ترجمة إلى اللغة اليومية

هذه الضبطات التي نكتبها بأنفسنا بين قوسي النموذج، قبل إطلاق التعلّم.

أصل البادئة

تشير البادئة «hyper-» إلى مستوى أعلى: هذه المقادير تقع فوق المعاملات، إذ تشترط الطريقة التي ستُحدَّد بها هذه الأخيرة.

نقطة انتباه — تجانس لفظي إحصائي

في الإحصاء البايزي، يشير «معامل فائق» إلى معامل قانون الاحتمال القبلي الحامل على معاملات النموذج. والمعنيان يتقاسمان فكرة المستوى الثاني نفسها، لكنهما لا يغطيان الكائنات نفسها. وفي سياق التعلّم الآلي التطبيقي، المعنى المعطى أعلاه هو السائد.

3.1 المعاملات الفائقة المعتادة حسب عائلة الخوارزميات

الخوارزميةالمعامل الفائقالدورأثر الزيادة
انحدار لوجستيCمقلوب قوة التنظيمتنظيم أضعف، معاملات أكثر حرية، قدرة متزايدة
انحدار لوجستيpenalty / l1_ratioطبيعة الجزاء (L1، L2، مختلط)L1 يلغي معاملات، L2 يقلّصها
Ridge، Lasso، ElasticNetalphaقوة التنظيممعاملات أكثر تقييداً، قدرة منخفضة
شجرة قرارmax_depthعمق أقصىشجرة أعمق، قدرة متزايدة، فرط تخصيص محتمل
شجرة قرارmin_samples_leafعدد أدنى لورقةأوراق أكثر ازدحاماً، شجرة أكثر انتظاماً، قدرة منخفضة
شجرة قرارccp_alphaتكلفة تعقيد للتقليمتقليم أشد، قدرة منخفضة
غابة عشوائيةn_estimatorsعدد أشجار مجمَّعةتباين تنبؤ منخفض، تكلفة حساب متزايدة
غابة عشوائيةmax_featuresمتغيرات مرشَّحة لكل تقسيمأشجار أكثر ارتباطاً فيما بينها، كسب التجميع منخفض
Gradient boostinglearning_rateخطوة تقلّص كل شجرةتعلّم أسرع، خطر فرط تخصيص متزايد
Gradient boostingn_estimatorsعدد تكرارات boostingقدرة متزايدة، فرط تخصيص ممكن بلا توقف مبكر
Gradient boostingsubsampleكسر ملاحظات لكل تكرارتنظيم عشوائي أقل عندما يميل إلى 1
أقرب k جيرانn_neighbors (k)عدد جيران مستشارينحد أكثر نعومة، قدرة منخفضة
SVMCجزاء انتهاكات الهامشهامش أضيق، ملاءمة أشد للبيانات
SVMkernel، gammaشكل الحدgamma مرتفع: حد محلي جداً، فرط تخصيص
بيرسبترون متعدد الطبقاتhidden_layer_sizesعمارة الشبكةمزيد من معاملات للتعلّم، قدرة متزايدة
بيرسبترون متعدد الطبقاتalphaتنظيم L2 للأوزانأوزان أكثر تقييداً، قدرة منخفضة

نقطة انتباه على C وalpha: يحكم هذان المعاملان الفائقان الشيء نفسه — قوة التنظيم — لكن باتجاهين متعاكسين. alpha متناسب مع قوة الجزاء؛ وC مقلوبه. زيادة alpha تنظّم أكثر؛ وزيادة C تنظّم أقل. وهذا العكس مصدر خطأ دائم في المقابلة التقنية.

تعريف — قوة التنظيم: alpha وC

التعريف الدقيق

يضيف التنظيم إلى دالة الخسارة حداً يجازي مقدار المعاملات، لتقييد فضاء الحلول الجائزة. وتصبح المسألة المحلولة تقليل J(θ) = perte_sur_les_données(θ) + λ · pénalité(θ). ويعرض Ridge وLasso λ مباشرة باسم alpha؛ ويعرض الانحدار اللوجستي وSVM C، المعرَّف كمقلوب λ بثابت تقريباً.

ترجمة إلى اللغة اليومية

alpha فرامل: كلما كبر، قُيِّد النموذج أكثر. وC هو إذن: كلما كبر، كان النموذج أكثر حرية في الالتصاق بالبيانات.

نقطة انتباه

لا معنى للتنظيم إلا على متغيرات بمقياس قابل للمقارنة: مجازاة معاملات تحمل على وحدات متغايرة يعود إلى مجازاة بعض المتغيرات اعتباطياً. التوحيد في الفصل 023، والتنظيم في الفصل 047.

تعريف — معدّل التعلّم (learning rate)

التعريف الدقيق

معامل جدائي مطبَّق على اتجاه تحديث المعاملات في كل تكرار لأمثلة تكرارية: في نزول تدرّجي، θ_(t+1) = θ_t − η · ∇J(θ_t)، حيث η يشير إلى معدّل التعلّم. وفي gradient boosting، يُفسَّر الضبط نفسه كعامل تقلّص مطبَّق على مساهمة كل مقدِّر مضاف.

ترجمة إلى اللغة اليومية

حجم الخطوة المنجَزة في كل تصحيح. خطوة كبيرة جداً تُفوِّت الحد الأدنى ويمكن أن تجعل التعلّم يتباعد؛ وخطوة صغيرة جداً لا تتقدم بسرعة كافية لميزانية التكرارات المتاحة.

نقطة انتباه

learning_rate وn_estimators مقترنان في boosting: قسمة معدّل التعلّم على اثنين تفرض تقريباً مضاعفة عدد التكرارات لبلوغ ملاءمة قابلة للمقارنة. فلا يجب إذن أبداً ضبط هذين المعاملين الفائقين مستقلين أحدهما عن الآخر. معالَج في الفصل 039.

3.2 الوظائف الخمس لمعامل فائق

ليست لكل المعاملات الفائقة المدى نفسه. وتصنيفها حسب الوظيفة يتجنّب ضبطها عشوائياً.

المعاملات الفائقة للقدرة حاسمة وتُضبَط بالأولوية؛ وتلك للأمثلة تثقل خصوصاً في boosting والشبكات العصبية؛ وتلك لبنية التجميع ذات مردود متناقص بسرعة؛ وتلك لمعالجة المسألة تصبح حرجة في سياق مختل أو بتكاليف خطأ غير متماثلة؛ وتلك للتنفيذ بلا أي أثر في التوقع على الأداء.

نقطة انتباه على random_state: هذا الوسيط معامل فائق شكلياً — يُثبَّت قبل التدريب ولا يضبطه الإجراء. ومع ذلك لا يجب أبداً إدراجه في بحث تحسين. وانتقاء البذرة التي تعظّم درجة التحقّق يعود إلى استغلال ضجيج المعاينة، لا إلى تحسين النموذج. والدور المشروع لـ random_state هو قابلية إعادة الإنتاج.


4. معيار التمييز التشغيلي، حالات حدّية وفخاخ

4.1 السؤال الوحيد الواجب طرحه

سؤال واحد يفصل الفئتين، أيّاً كانت المكتبة أو الخوارزمية المستعمَلة:

هل يضبط هذا المقدار إجراء الأمثلة المنفَّذ أثناء fit()، أم يُثبَّت قبل أن يبدأ هذا الإجراء؟

تعريف — اصطلاح التسمية في scikit-learn

القاعدة المعيارية للمكتبة

في واجهة scikit-learn، يتجسّد التمييز في التسمية:

  • المعاملات الفائقة وسائط منشئ المقدِّر؛ وهي متاحة بـ get_params()، وقابلة للتعديل بـ set_params()، و اسمها لا يتضمّن لاحقة؛
  • السمات المتعلَّمة أثناء fit() تحمل اسماً ملحقاً بشرطة سفلية: coef_، intercept_، feature_importances_، classes_، tree_، estimators_، support_vectors_.

النتيجة العملية

الوصول إلى سمة ملحقة قبل أي استدعاء لـ fit() يثير استثناء NotFittedError. وهذا أسرع اختبار للحسم: سمة لا توجد قبل التدريب متعلَّمة حتماً.

نقطة انتباه اصطلاحية

تُدعى الطريقة get_params() في حين أنها تعيد المعاملات الفائقة. وهذا اختيار تسمية يعود إلى الاصطلاح العام للبرمجة، حيث يشير «معامل» إلى وسيط دالة. وهو يغذي خلطاً مؤسفاً مع الاصطلاح الإحصائي. وفي هذا المقرر، وفي المقابلة، يحفظ «معامل» دائماً معناه الإحصائي: مقدار مقدَّر انطلاقاً من البيانات.

4.2 تصنيف حالات ملموسة

المقدارالفئةالتبرير
coef_ لانحدار لوجستيمعامليحسبه الحالّ لتقليل الخسارة
C لانحدار لوجستيمعامل فائقيجب أن يُعرَف قبل استدعاء الحالّ
عتبة 32,50 على anciennete_mois في شجرةمعاملينتقيه بحث التقسيم
max_depth لشجرةمعامل فائقيحدّ البحث، وليس صادراً عنه
feature_importances_ لغابةمعامل مشتقمحسوب انطلاقاً من البنية المتعلَّمة
n_estimators لغابةمعامل فائقيثبّت عدد الأشجار الواجب بناؤها
max_iter لحالّمعامل فائقميزانية ممنوحة قبل البدء
n_iter_ لحالّنتيجة تنفيذعدد التكرارات المستهلكة فعلاً
mean_ وscale_ لـ StandardScalerمعامل المحوِّلمقدَّران على بيانات التدريب
k لـ KNeighborsClassifierمعامل فائقمثبت قبل، لا يحسّنه fit() أبداً
عدد المتجهات الداعمة المحصَّلنتيجة تنفيذنتيجة للأمثلة الثنائية
عدد مكوّنات ACPمعامل فائقمختار قبل؛ والمحاور نفسها متعلَّمة
عتبة قرار عند 0,50معامل فائق للقراراصطلاح افتراضي، غير صادر عن fit()
random_stateمعامل فائق للتنفيذمثبت قبل، لكن لا يجب تحسينه

4.3 الحالات الحدّية الأربع الواجب إتقانها

الحالة الحدّية 1 — إحصاءات معالِج مسبق. متوسط وانحراف معياري لـ StandardScaler مقدَّران انطلاقاً من البيانات: إنهما معاملان بمعنى إجراء fit()، حتى إن لم ينتميا إلى النموذج التنبؤي. نتيجة حاسمة: يُقدَّران على مجموعة التدريب وحدها ثم يُطبَّقان كما هما على المجموعات الأخرى. وتقديرهما على مجموع البيانات يشكّل تسرّب معلومة (الفصل 028).

الحالة الحدّية 2 — التوقف المبكر. مع early_stopping=True، يُحدَّد عدد التكرارات المحتفَظ به بالإجراء نفسه، برصد الخسارة على مجموعة تحقّق داخلية. يبدو الحد ضبابياً؛ وهو ليس كذلك. فقرار تفعيل التوقف المبكر وحجم هذه المجموعة الداخلية والصبر والمقياس المراقَب تبقى معاملات فائقة مثبتة مسبقاً؛ وعدد التكرارات المحتفَظ به نتيجة.

الحالة الحدّية 3 — المعاملات الفائقة المحسَّنة آلياً. أن يحدد بحث على شبكة max_depth لا يحوّله إلى معامل: البحث حلقة خارجية تعيد إطلاق تدريبات كاملة، كل منها بقيمة مثبتة مسبقاً. ويُضبَط معامل داخل تدريب، ويُختار معامل فائق بين عدة تدريبات (الفصل 035).

الحالة الحدّية 4 — المعاملات المشتقة. feature_importances_ ليس محسَّناً مباشرة: إنه إحصائية محسوبة بعدئذ انطلاقاً من تقليلات عدم النقاء للبنية المتعلَّمة. وهو مع ذلك يندرج تحت المقادير المتعلَّمة، إذ لا يوجد قبل fit() ويعتمد بالكامل على البيانات. والملاحظة نفسها لـ coef_ لـ SVM خطي، المعاد تركيبه انطلاقاً من المعاملات الثنائية.


5. التحقّق في الشفرة: get_params() مقابل coef_ وfeature_importances_

تصف مجموعة بيانات العرض 4 000 زبون لمشغّل اتصالات، بخمسة متغيرات توضيحية وهدف ثنائي a_resilie نسبة موجباته 0,3795.

5.1 المعاملات الفائقة: get_params()

python
from sklearn.linear_model import LogisticRegression
from sklearn.preprocessing import StandardScaler
import pandas as pd, numpy as np

Xs = pd.DataFrame(StandardScaler().fit_transform(X), columns=X.columns)

lr = LogisticRegression(C=1.0, max_iter=1000, random_state=0)
lr.fit(Xs, y)

for k, v in sorted(lr.get_params().items()):
    print(f"{k}: {v!r}")
C: 1.0
class_weight: None
dual: False
fit_intercept: True
intercept_scaling: 1
l1_ratio: 0.0
max_iter: 1000
n_jobs: None
penalty: 'deprecated'
random_state: 0
solver: 'lbfgs'
tol: 0.0001
verbose: 0
warm_start: False

التفسير. تُعرَض أربعة عشر ضبطاً في حين أن ثلاثة فقط رُصدت؛ والأحد عشر الأخرى القيم الافتراضية للمقدِّر. وكلها كانت معروفة قبل fit() ولم يعدّل أي منها: استدعاء ثان بعد التدريب يعيد القاموس نفسه.

نقطة انتباه على القيم الافتراضية. نموذج مُنشأ بلا وسيط ليس نموذجاً «بلا معاملات فائقة»: إنه نموذج أخذت كل معاملاته الفائقة قيمها الافتراضية، وهي اصطلاحات مكتبة لا أمثلات. وC=1.0 ينظّم بالفعل جوهرياً.

نقطة انتباه على الإصدارات. المخرج يأتي من scikit-learn 1.8، حيث penalty قيد الإهمال لصالح l1_ratio، والقيمة 0.0 تشير إلى جزاء L2 صرف؛ وتعرض الإصدارات السابقة penalty: 'l2'. والمعاملات الفائقة تنتمي إلى واجهة مكتبة وتتطور معها؛ والمعاملات المتعلَّمة تندرج تحت الصياغة الرياضية للنموذج ولا تغيّر اسمها.

5.2 المعاملات المتعلَّمة: coef_ وintercept_

python
print(pd.Series(np.round(lr.coef_[0], 4), index=X.columns).to_string())
print("intercept_:", np.round(lr.intercept_, 4))
print("n_iter_:", lr.n_iter_)
print("classes_:", lr.classes_)
anciennete_mois     -0.8957
facture_mensuelle    0.5515
nb_appels_support    0.5829
satisfaction        -0.7586
data_go_moyen       -0.0216
intercept_: [-0.6809]
n_iter_: [6]
classes_: [0 1]

التفسير. هذه الأعداد الستة — خمسة معاملات وثابت — تشكّل كامل ما تعلّمه النموذج، ولم يكتب المهندس أيها. والمتغيرات موحَّدة، فالمعاملات قابلة للمقارنة فيما بينها: تهيمن الأقدمية، واستهلاك البيانات ضئيل.

المتغيرالمعاملنسبة الأرجحيةالقراءة المهنية
anciennete_mois−0,89570,41انحراف معياري أقدمية إضافي يقسم أرجحية الإلغاء على 2,4
satisfaction−0,75860,47انحراف معياري رضا إضافي يقسم الأرجحية على 2,1
nb_appels_support+0,58291,79انحراف معياري مكالمات إضافي يضاعف الأرجحية بـ 1,8
facture_mensuelle+0,55151,74أثر قابل للمقارنة، بالاتجاه نفسه
data_go_moyen−0,02160,98بلا أثر قابل للاستغلال

نقطة انتباه. يحمل n_iter_ وclasses_ شرطة سفلية نهائية و لا يوجدان إلا بعد fit()، دون أن يكونا من الطبيعة نفسها لـ coef_. وn_iter_ تشخيص تقارب: القيمة 6، الأدنى بكثير من الميزانية max_iter=1000، تشير إلى تقارب بلا انقطاع. وقيمة مساوية لـ max_iter ستشير إلى توقف باستنفاد الميزانية، إذن نموذج غير متقارب.

5.3 شجرة: معاملات فائقة مفروضة مقابل بنية متعلَّمة

python
from sklearn.tree import DecisionTreeClassifier, export_text

dt = DecisionTreeClassifier(max_depth=3, min_samples_leaf=50, random_state=0)
dt.fit(X, y)

print("noeuds:", dt.tree_.node_count, "profondeur:", dt.get_depth(),
      "feuilles:", dt.get_n_leaves())
print(export_text(dt, feature_names=list(X.columns), decimals=2))
print(pd.Series(np.round(dt.feature_importances_, 4), index=X.columns).to_string())
noeuds: 15 profondeur: 3 feuilles: 8
|--- anciennete_mois <= 32.50
|   |--- satisfaction <= 2.50
|   |   |--- nb_appels_support <= 0.50
|   |   |   |--- class: 1
|   |   |--- nb_appels_support >  0.50
|   |   |   |--- class: 1
|   |--- satisfaction >  2.50
|   |   |--- facture_mensuelle <= 59.15
|   |   |   |--- class: 0
|   |   |--- facture_mensuelle >  59.15
|   |   |   |--- class: 1
|--- anciennete_mois >  32.50
|   |--- satisfaction <= 2.50
|   |   |--- nb_appels_support <= 1.50
|   |   |   |--- class: 0
|   |   |--- nb_appels_support >  1.50
|   |   |   |--- class: 1
|   |--- satisfaction >  2.50
|   |   |--- facture_mensuelle <= 59.45
|   |   |   |--- class: 0
|   |   |--- facture_mensuelle >  59.45
|   |   |   |--- class: 0

anciennete_mois      0.4497
facture_mensuelle    0.1065
nb_appels_support    0.1156
satisfaction         0.3282
data_go_moyen        0.0000

ما فُرض. قيمتان فقط، max_depth=3 و min_samples_leaf=50. والعمق المحصَّل يساوي 3 بالضبط: القيد نشط، وبدونه كانت الشجرة ستواصل النمو.

ما تُعلِّم. سبعة تقسيمات داخلية، كل منها معرَّف بزوج (متغير، عتبة)، وثماني أوراق مع توزيع فئاتها. والقيم 32,50 و2,50 و59,15 و0,50 و1,50 و59,45 كلها صادرة عن بحث التقسيم. وأن تُقطَع facture_mensuelle عند 59,15 في شعبة وعند 59,45 في أخرى يبيّن أنها مقادير مقدَّرة محلياً، لا عتبات مهنية.

الأهميات. feature_importances_ متجه مجموعه 1 يوزّع تقليل عدم النقاء الكلي بين المتغيرات. ويحصل data_go_moyen على 0,0000: تحت قيد العمق هذا، لم يُحتفَظ بالمتغير قط لتقسيم. فهذا الصفر لا يعني إذن «بلا رابط مع الهدف» بل «لم يُنتقَ قط في هذه الشروط»؛ وعمق أعلى سيسند إليه أهمية غير معدومة. حدود هذا المؤشر في الفصل 080.

زوجان من الشعب الفرعية ينتهيان إلى الفئة المتنبَّأ بها نفسها. ومع ذلك احتُفظ بالتقسيم لأنه يقلّل عدم النقاء: فاحتمالات التنبؤ تختلف، حتى عندما تتطابق الفئة الأغلبية (الفصل 029).

5.4 معامل فائق يحدد عدد المعاملات

python
for d in [2, 3, 5, 10, None]:
    m = DecisionTreeClassifier(max_depth=d, random_state=0).fit(X, y)
    print(f"max_depth={str(d):>4} -> noeuds={m.tree_.node_count:>5}"
          f"  feuilles={m.get_n_leaves():>5}  acc_train={m.score(X, y):.4f}")
max_depth=   2 -> noeuds=    7  feuilles=    4  acc_train=0.6980
max_depth=   3 -> noeuds=   15  feuilles=    8  acc_train=0.7202
max_depth=   5 -> noeuds=   63  feuilles=   32  acc_train=0.7445
max_depth=  10 -> noeuds=  757  feuilles=  379  acc_train=0.8498
max_depth=None -> noeuds= 2033  feuilles= 1017  acc_train=1.0000

التفسير. معامل فائق وحيد ينقل النموذج من 7 إلى 2 033 عقدة متعلَّمة، أي عامل 290، وتتقدم دقة التدريب حتى 1,0000: تعزل الشجرة غير المقيَّدة كل ملاحظة. وهذه القيمة ليست نجاحاً بل حفظاً — على بيانات ضوضائية نسبة الموجبات فيها 0,38، لا يصنّف أي نموذج نزيه مجموعة تدريبه بكمال (الفصل 031).

5.5 الآلية نفسها على التنظيم

python
for C in [0.001, 0.01, 0.1, 1.0, 100.0]:
    m = LogisticRegression(C=C, max_iter=1000).fit(Xs, y)
    print(f"C={C:<8} coef_={np.round(m.coef_[0], 3)}  "
          f"norme_L2={np.linalg.norm(m.coef_):.3f}")
C=0.001    coef_=[-0.336  0.205  0.22  -0.283 -0.002]  norme_L2=0.533
C=0.01     coef_=[-0.737  0.451  0.479 -0.623 -0.014]  norme_L2=1.168
C=0.1      coef_=[-0.877  0.539  0.57  -0.742 -0.021]  norme_L2=1.392
C=1.0      coef_=[-0.896  0.551  0.583 -0.759 -0.022]  norme_L2=1.422
C=100.0    coef_=[-0.898  0.553  0.584 -0.76  -0.022]  norme_L2=1.425

التفسير. لا يظهر C أبداً في coef_ لكنه يحكم مداه: تنتقل نظيم المعاملات من 0,533 إلى 1,425 عندما ينمو C من 0,001 إلى 100. والتقليص منتظم ويحفظ ترتيب المتغيرات. وبعد C=1، لا تتحرك المعاملات عملياً: أصبح الجزاء ضئيلاً أمام حد الخسارة. واستكشاف C=10 000 سيكون بلا أثر هنا، وهو ما يبرر الشبكات اللوغاريتمية المحدودة (الفصل 035).

صياغة للحفظ: المعاملات الفائقة ليست في النموذج إلى جانب المعاملات، إنها القيود التي حُسبت تحتها المعاملات.


6. لماذا لا تُضبَط المعاملات الفائقة أبداً على مجموعة الاختبار

6.1 المبدأ

ضبط معامل فائق يفترض مقارنة عدة تدريبات و الاحتفاظ بالأفضل، وهو ما يتطلب مجموعة غير مستعمَلة لضبط المعاملات. والإغراء هو استعمال مجموعة الاختبار، إذ هي التي تحمل تقدير الأداء. وهذا بالضبط الاستعمال المحظور عليها.

كل قرار يُتَّخذ بالنظر إلى مجموعة بيانات ينقل معلومة من هذه المجموعة إلى النموذج. فتتوقف المجموعة عندئذ عن كونها غير مسبوقة، و تتوقف الدرجة التي تنتجها عن تقدير الأداء على بيانات جديدة.

المجموعةما يُقرَّر فيهاعدد المراجعاتما تقدّره درجتها
تدريبمعاملات النموذجمرة لكل تدريبالقدرة على إعادة إنتاج البيانات المرئية، بلا قيمة تنبؤية
تحقّقالمعاملات الفائقة، الخوارزمية، العتبة، المتغيرات المحتفَظ بهامرة لكل تكوين مجرَّبأداء متفائل، منحاز بالانتقاء
اختبارلا شيءمرة واحدة فقط، في النهايةالأداء المتوقَّع على بيانات جديدة

6.2 الآلية الكمّية لتحيز الانتقاء

الدرجة المحصَّلة على مجموعة منتهية مشوبة بتباين معاينة: على 800 ملاحظة تحقّق، الانحراف المعياري لدقة قريبة من 0,75 يساوي نحو 0,015. ومقارنة K تكويناً و الاحتفاظ بالحد الأقصى يعود إلى انتقاء، من بين K سحوبات ضوضائية، ذلك الذي ضجيجُه الأكثر مواتاة.

التكوينات المقارنةالفرق المتوقَّع بين الحد الأقصى المرصود والأداء الحقيقي
1نحو 0,000
10نحو +0,023
50نحو +0,032
200نحو +0,040

تقابل أوامر الحجم هذه توقّع الحد الأقصى لـ K متغيرات غوسية متمركزة بانحراف معياري 0,015. والاستنتاج بنيوي ولا يعتمد على العناية المبذولة في المسلك: درجة التكوين المحتفَظ به متفائلة بالبناء. فمجموعة إضافية، بقيت خارج كل قرار، ضرورية إذن للحصول على تقدير غير منحاز.

6.3 صياغات تشغيلية

  • مجموعة الاختبار ميزانية استعمال وحيد: تُستهلك عندما ننظر إليها، لا عندما نعدّلها.
  • ما إن يُحكَم أي اختيار على مجموعة — معامل فائق، خوارزمية، عتبة، مجموعة جزئية من المتغيرات، استراتيجية إسناد — تلعب هذه المجموعة دور مجموعة تحقّق، أيّاً كان اسم المتغير الذي يحتويها. ومجموعة اختبار مراجَعة عدة مرات تتدهور هكذا إلى مجموعة تحقّق، بصورة تدريجية وغير مرئية في المقاييس.
  • الفجوة بين الأداء المعلَن في اجتماع وذلك المرصود في الإنتاج تجد هنا أحد سببيها الرئيسيين، والآخر هو تسرّب المعلومة المعالَج في الفصل 028.

إحالات: بناء المجموعات الثلاث معالَج في الفصل 026، و مخططات التجزئة الخاصة في الفصل 027، والتحقّق المتقاطع في الفصل 034، وإجراءات بحث المعاملات الفائقة في الفصل 035، و اختيار عتبة القرار في الفصل 062.


7. قدرة نموذج وموازنة التحيز–التباين

تعريف — قدرة نموذج (model capacity)

التعريف الدقيق

قياس ثراء عائلة الدوال التي تستطيع خوارزمية، مكوَّنة بطريقة معينة، تمثيلها. وهي مصاغة ببعد Vapnik-Chervonenkis (Vapnik وChervonenkis، 1971) — عدد أكبر مجموعة نقاط تستطيع العائلة فصلها حسب كل الوسوم الممكنة — أو بمقاييس قريبة مثل تعقيد Rademacher.

الدور الخاص لفئتي المقادير

المعاملات الفائقة تحدّد فضاء الفرضيات H؛ والمعاملات تنتقي عنصراً h داخل H. وزيادة القدرة هي توسيع H.

ترجمة إلى اللغة اليومية

إلى أي حد يمكن لنموذج أن يلازم شكل البيانات. قدرة غير كافية تمنعه من تمثيل الظاهرة؛ وقدرة مفرطة تتيح له ملازمة الضجيج أيضاً.

نقطة انتباه

القدرة ليست الأداء: تبلغ شجرة غير مقيَّدة دقة كاملة على التدريب ويمكن أن تكون متوسطة على بيانات جديدة (الفقرة 5.4).

المعامل الفائقزيادة قيمتهالقدرةالخطر المهيمن إن دُفع إلى الطرف
max_depthشجرة أعمقتزيدفرط تخصيص
min_samples_leafأوراق أكثر ازدحاماًتنقصنقص تخصيص
alpha (Ridge، Lasso، MLP)جزاء أقوىتنقصنقص تخصيص
C (لوجستي، SVM)جزاء أضعفتزيدفرط تخصيص
n_neighbors (k)جوار أوسعتنقصنقص تخصيص
hidden_layer_sizesشبكة أوسع أو أعمقتزيدفرط تخصيص
gamma (نواة RBF)تأثير أكثر محليةتزيدفرط تخصيص بارز
learning_rate (boosting)خطوة أكبرتزيد عند ميزانية تكرارات ثابتةفرط تخصيص
n_estimators (غابة عشوائية)مزيد من أشجار مجمَّعةيثبّت التباينتكلفة حساب، بلا تدهور ملحوظ

نقطة انتباه على n_estimators. الصف الأخير استثناء. في غابة عشوائية، زيادة عدد الأشجار تقلّل تباين المجمَّع بلا زيادة فرط التخصيص، بمردود متناقص بسرعة. وفي boosting، يصحّح كل تكرار بواقي السابقة: يزيد n_estimators القدرة ويجب تقييده، بتوقف مبكر أو بتحقّق. فتسمية واحدة تغطي إذن سلوكين متعاكسين حسب عائلة الخوارزميات.

الموازنة. قدرة غير كافية تنتج خطأ منهجياً، التحيز: يفشل النموذج على التدريب كما على الاختبار. و قدرة مفرطة تنتج حساسية لمجموعة التدريب الخاصة، التباين: ينجح النموذج على التدريب ويفشل على بيانات جديدة. وضبط المعاملات الفائقة للقدرة يعود إلى التحكيم بين هذين النظامين. موازنة التحيز–التباين في الفصل 032، وفرط التخصيص و نقص التخصيص في الفصل 031، وروافع التصحيح في الفصل 033.


8. المفردات المرتبطة: خسارة، مقياس، درجة، عتبة، مرجع ساذج

تُقدَّم هذه المفاهيم الخمسة هنا لأنها لا تنفصل عن التمييز السابق: الخسارة ما تقلّله الأمثلة لإنتاج المعاملات، والمقياس ما يقارنه التحقّق لاختيار المعاملات الفائقة، والعتبة والمرجع الساذج قراران هندسيان لا يتعلّم شيئاً. وكل منها معالَج بعمق لاحقاً.

تعريف — دالة الخسارة (loss function)

التعريف الدقيق

دالة ℓ(y, ŷ) تربط زوجاً مكوَّناً من قيمة مرصودة و قيمة متنبَّأ بها بعدد حقيقي موجب يقيس تكلفة الفرق. ومتوسطها على مجموعة التدريب يشكّل الخطر التجريبي، الكمية المقلَّلة فعلاً بإجراء الأمثلة. ويُتحدَّث بلا تمييز عن دالة تكلفة أو دالة هدف أو معيار.

ترجمة إلى اللغة اليومية

قياس الخطأ الذي يسعى النموذج إلى تقليله أثناء تعلّمه. هذه النقاط المفقودة، ويقوم التعلّم على فقد أقل ما يمكن منها.

القيد التقني

يجب أن تكون دالة خسارة قابلة للأمثلة بالإجراء المستعمَل: غالباً قابلة للاشتقاق، أو على الأقل قابلة للتفكيك إلى معايير محلية، وهو ما يستبعد معظم مقاييس المجال.

نقطة انتباه

تُحسَب الخسارة على مجموعة التدريب أثناء التعلّم. و خسارة ضعيفة على التدريب لا تخبر شيئاً عن التعميم. و مقارنة خسائر التدريب والتحقّق معالَجة في الفصل 030.

المهمةالخسارة المعتادةما تجازيه
انحدارخطأ تربيعي متوسط (MSE)مربع الفرق، إذن بقوة الفروق الكبيرة
انحدار متينخطأ مطلق (MAE)، خسارة Huberخطياً، إذن أقل حساسية للقيم المتطرفة
تصنيف احتماليإنتروبيا متقاطعة، log lossالثقة الممنوحة لتنبؤ خاطئ
SVMخسارة مفصلية (hinge)انتهاكات الهامش
تقسيم شجرةعدم نقاء جيني، إنتروبياتغاير الفئات في عقدة
تعريف — مقياس التقييم (evaluation metric)

التعريف الدقيق

مقدار محسوب انطلاقاً من تنبؤات نموذج والقيم المرصودة، موجَّه لتوصيف أدائه بهدف مقارنة أو قرار. ولا يتدخل في أمثلة المعاملات ولا يخضع لأي قيد قابلية اشتقاق.

ترجمة إلى اللغة اليومية

الرقم الذي نقدّمه لنقول إن النموذج جيد، وحسب أي معيار.

التمييز عن الخسارة

الخسارة تخدم التعلّم، والمقياس يخدم الحكم. ويمكن لمصنِّف أن يقلّل الإنتروبيا المتقاطعة وهو يُقيَّم بالاستدعاء: إنهما مقداران مختلفان محسوبان على التنبؤات نفسها.

نقطة انتباه

ينحاز المقياس إلى الرهان المهني، لا إلى التسهيل الرياضي. واختيار المقياس معالَج في الفصول 052 إلى 075، والمبدأ الموجِّه للمقرر مذكَّر به في الفصل 075: السؤال ليس أي مقياس الأفضل، بل أي خطأ يكلف أكثر.

المعياردالة الخسارةمقياس التقييم
الغايةتوجيه الأمثلةالتوصيف والتواصل
المستعمِلةإجراء fit()المهندس ومتخذ القرار المهني
القيدقابل للأمثلة، عموماً قابل للاشتقاقلا شيء
لحظة الحسابفي كل تكرار للتدريببعد التنبؤ، على مجموعة محجوزة
أمثلةMSE، log loss، hinge، Giniدقة، دقة موجبة، استدعاء، F1، AUC، MAE، R²
يختارهمفروض إلى حد كبير بالخوارزميةالمهندس، حسب تكلفة الأخطاء
تشبيه — سلم التنقيط والتقدير

طالب يراجع لامتحاناً. سلم التنقيط يقول له كم نقطة يفقد على كل نوع خطأ: هذا ما يسعى إلى تقليله بالعمل. هذه دالة الخسارة.

والتقدير الموضوع على كشفه — مقبول، جيد، جيد جداً — هو ما سينظر إليه صاحب العمل. هذا المقياس.

ويُحسَبان على النسخة نفسها ولا يتطابقان: نسختان فقدتا العدد نفسه من النقاط يمكن أن تتلقيا تقديرات مختلفة حسب توزيع الأخطاء بين الاختبارات.

وتحسين السلم دون النظر أبداً إلى التقدير خطأ منهجي شائع: نموذج تنقص خسارته بانتظام يمكن أن يرى مقياسه المهني يركد أو يتدهور.

تعريف — الدرجة (score)

التعريف الدقيق

يغطي المصطلح معنيين متميّزين يجب عدم خلطهما أبداً.

المعنى 1 — درجة خرج النموذج. قيمة متصلة ينتجها النموذج لملاحظة، قبل أي قرار: احتمال مقدَّر يعيده predict_proba()، أو قيمة غير معايرة يعيدها decision_function(). ودرجة ليست فئة.

المعنى 2 — درجة أداء. قيمة عددية لمقياس تقييم على مجموعة بيانات. وهذا معنى model.score(X, y) في scikit-learn، الذي يعيد الدقة لمصنِّف ومعامل التحديد R² لمنحدر.

اصطلاح scikit-learn

تتبع دوال التقييم قاعدة «الأكبر أفضل». فمقاييس الخطأ، الواجب تقليلها، تُعرَض إذن على شكل سالب: neg_mean_squared_error، neg_log_loss. وقيمة سالبة يعرضها بحث على شبكة ليست شذوذاً.

نقطة انتباه

الإعلان «درجة النموذج 0,91» بلا أي قيمة إعلامية ما لم يُسمَّ المقياس ومجموعة البيانات.

تعريف — عتبة القرار (decision threshold)

التعريف الدقيق

قيمة قطع مطبَّقة على الدرجة المتصلة التي ينتجها مصنِّف لتحويل هذه الدرجة إلى قرار متقطع. ولمسألة ثنائية، تُسنَد الملاحظة إلى الفئة الموجبة عندما تكون الدرجة المقدَّرة أعلى من العتبة أو مساوية لها.

ترجمة إلى اللغة اليومية

من أي مستوى احتمال نقرر الفعل.

الوضع بالنظر إلى الفصل

العتبة ليست متعلَّمة. والقيمة 0,50 اصطلاح افتراضي، لا أمثل. والعتبة معامل فائق للقرار، يُضبَط على مجموعة تحقّق، لا أبداً على مجموعة الاختبار.

نقطة انتباه

خفض العتبة يزيد عدد الموجبات المتنبَّأ بها، إذن الاستدعاء، على حساب الدقة الموجبة؛ ورفعها ينتج الأثر المعاكس. والضبط يندرج تحت موازنة اقتصادية بين تكلفة موجب كاذب وتكلفة سالب كاذب. معالَج في الفصلين 029 و062.

تعريف — المرجع الساذج (baseline)

التعريف الدقيق

نموذج مرجعي تافه عمداً، يخدم حداً أدنى يُقارَن به كل نموذج مرشَّح. وأداؤه يشكّل العتبة التي دونها لا يقدّم نموذج متعلَّم أي قيمة.

مراجع معتادة

المهمةمرجع ساذجالتنفيذ
تصنيفالتنبؤ منهجياً بالفئة الأغلبيةDummyClassifier(strategy="most_frequent")
تصنيفسحب عشوائي حسب التواترات المرصودةDummyClassifier(strategy="stratified")
انحدارالتنبؤ بمتوسط الهدفDummyRegressor(strategy="mean")
انحدارالتنبؤ بوسيط الهدفDummyRegressor(strategy="median")
سلاسل زمنيةإعادة آخر قيمة مرصودةنموذج استمرار
سياق صناعيالقاعدة المهنية حالياً في الإنتاجإعادة تنفيذ القاعدة القائمة

ترجمة إلى اللغة اليومية

قبل الجزم بأن نموذجاً ذو أداء، يجب التحقّق من أنه يفعل أفضل من استراتيجية حمقاء.

نقطة انتباه

على مجموعة مختلة بـ 2 % موجبات، يبلغ المرجع الساذج «فئة أغلبية» 98 % دقة بلا أي تعلّم. فدقة 97 % معلَنة لنموذج معقَّد تشكّل عندئذ تراجعاً. وهذا سبب بدء كل تقييم بحساب المرجع. معالَج في الفصلين 049 و050.

المفهومالدور في السلسلةمن يحددهفصل المعالجة
دالة خسارةتوجّه ضبط المعاملاتمفروضة بالخوارزمية، قابلة للتكوين أحياناً030
مقياسيقارن النماذج والتكويناتالمهندس، حسب الرهان المهني052 إلى 075
درجةخرج متصل، أو قيمة مقياسالنموذج، أو المقياس المختار029، 061، 063
عتبةتحوّل درجة إلى قرارالمهندس، على مجموعة تحقّق062، 088
مرجع ساذجيثبّت حد القيمة المضافةالمهندس، قبل أي نمذجة049

9. أخطاء استدلال شائعة

خطأ — تسمية «معاملات» الوسائط الممرَّرة للمنشئ

تعبير «ضبطت نموذجي بـ max_depth يساوي 5» غامض وتغذي الطريقة get_params() الخلط، إذ تعيد في الواقع المعاملات الفائقة. واصطلاح البرمجة و اصطلاح الإحصاء يتباعدان هنا.

الصياغة الصحيحة: «ثبّتُ المعامل الفائق max_depth عند 5. و معاملات النموذج هي العتبات وبنية الشجرة، التي حددها التدريب.»

خطأ — معالجة قيمة معامل فائق كجيدة عالمياً

لا قيمة معامل فائق أمثل في ذاتها. والقيمة الملائمة تعتمد على العدد وعدد المتغيرات ومستوى الضجيج وبنية الظاهرة. وقيمة مستأنفة من تدوينة أو مشروع سابق فرضية انطلاق، لا ضبطاً.

الصياغة الصحيحة: «تبيّن أن max_depth=5 أفضل موازنة على مجموعة البيانات هذه، إثر بحث مُصادَق عليه بتحقّق متقاطع.»

خطأ — ضبط المعاملات الفائقة على مجموعة الاختبار

يجب أن تبقى مجموعة الاختبار بمعزل عن كل قرار. وما إن يُقارَن تكوين فيها بآخر، فإنها تمارس وظيفة مجموعة تحقّق وتصبح الدرجة النهائية متفائلة. والتلوث تدريجي ولا ينتج أي إشارة تنبيه.

الصياغة الصحيحة: «انتُقيت المعاملات الفائقة بتحقّق متقاطع على مجموعة التدريب. ولم تُراجَع مجموعة الاختبار إلا مرة واحدة، للتقدير النهائي.»

خطأ — اعتبار إحصاءات معالِج مسبق مثبتة مسبقاً

متوسط وانحراف معياري لـ StandardScaler، والصيغ التي يحتفظ بها مرمِّز، وقيم الإسناد مقدَّرة انطلاقاً من البيانات. وحسابها على مجموع المجموعة قبل التجزئة ينقل معلومة من الاختبار إلى التدريب.

الصياغة الصحيحة: «هذه الإحصاءات مقادير متعلَّمة. وهي تُقدَّر على مجموعة التدريب وحدها، داخل خط أنابيب، و تُطبَّق بعدئذ على المجموعات الأخرى.» معالَج في الفصلين 028 و076.

خطأ — خلط دالة الخسارة ومقياس التقييم

خسارة تدريب تنقص بانتظام لا تضمن لا التعميم، ولا رضا المعيار المهني. والمقداران يجيبان عن غايتين مختلفتين ويمكن أن يتطورا باتجاهين متعاكسين.

الصياغة الصحيحة: «يقلّل النموذج الإنتروبيا المتقاطعة أثناء التدريب؛ ويُقيَّم بالاستدعاء، لأن تكلفة سالب كاذب تهيمن في حالة الاستعمال هذه.»

خطأ — افتراض أن زيادة القدرة تحسّن الأداء

تبلغ شجرة غير مقيَّدة دقة 1,0000 على بيانات تدريبها، كما تبيّن الفقرة 5.4. وهذه القيمة تقيس حفظاً، لا قدرة على التعميم. وبعد مستوى معين من القدرة، يزيد الخطأ على بيانات جديدة.

الصياغة الصحيحة: «بعد مستوى معين من القدرة، يلائم النموذج ضجيج مجموعة التدريب؛ فيتدهور خطأ التعميم في حين يواصل خطأ التدريب الانخفاض.»

خطأ — إدراج random_state في بحث المعاملات الفائقة

البذرة العشوائية مثبتة قبل التدريب، وهو ما يجعلها شكلياً معاملاً فائقاً، لكنها لا تحمل أي معلومة عن الظاهرة. والاحتفاظ بالبذرة التي تعظّم درجة التحقّق يعود إلى انتقاء ضجيج وينتج كسباً لن يتكرر.

الصياغة الصحيحة: «يُثبَّت random_state لضمان قابلية إعادة الإنتاج. وحساسية النموذج للبذرة تُقاس، ولا تُحسَّن.»

خطأ — الاعتقاد أن عتبة 0,50 ينتجها التدريب

يطبق predict() اصطلاحاً افتراضياً. وينتج النموذج درجة متصلة؛ والمكتبة، لا التعلّم، هي التي تقطعها عند 0,50.

الصياغة الصحيحة: «العتبة قرار هندسي، مضبوط على مجموعة تحقّق حسب التكلفة الخاصة للموجبات الكاذبة و السوالب الكاذبة.»


10. خلاصة

الفئتان
    معامل         متعلَّم بإجراء الأمثلة، أثناء fit()
                    معاملات، أوزان وانحيازات، عتبات وبنية شجرة،
                    معاملات ثنائية ومتجهات داعمة
    معامل فائق    يثبّته المهندس، قبل fit()
                    max_depth, n_estimators, k, learning_rate, alpha, C

معيار التمييز الوحيد
    هل يضبط هذا المقدار إجراء الأمثلة،
    أم كان يجب أن يُعرَف حتى يبدأ هذا الإجراء؟

اصطلاح SCIKIT-LEARN
    get_params()            -> المعاملات الفائقة
    attribut_ (شرطة سفلية)  -> المقادير المتعلَّمة
    coef_, intercept_, feature_importances_, tree_, support_vectors_
    قبل fit()، هذه السمات لا توجد: NotFittedError.

التشبيه المرجعي
    وصفة             = خوارزمية
    ضبطات الفرن      = معاملات فائقة
    ما يصبح عليه العجين = معاملات متعلَّمة
    كعكة              = نموذج

ما تحكمه المعاملات الفائقة
    القدرة              max_depth, C, alpha, k, hidden_layer_sizes
    الأمثلة             learning_rate, solver, max_iter, tol
    بنية التجميع        n_estimators, max_features, subsample
    معالجة المسألة      class_weight, criterion, عتبة
    التنفيذ             n_jobs, verbose, random_state

القدرة
    المعاملات الفائقة تحدّد فضاء الفرضيات H.
    المعاملات تنتقي عنصراً h في H.
    قدرة ضعيفة جداً -> تحيز مرتفع، نقص تخصيص.
    قدرة قوية جداً  -> تباين مرتفع، فرط تخصيص.

قاعدة البروتوكول
    تدريب   -> يضبط المعاملات
    تحقّق   -> يختار المعاملات الفائقة والعتبة
    اختبار  -> يقدّر الأداء، يُراجَع مرة واحدة فقط
    مجموعة يُقرَّر عليها تتوقف عن كونها مجموعة تقييم.

المفردات المرتبطة
    خسارة     ما تقلّله الأمثلة لإنتاج المعاملات
    مقياس     ما نقارنه لاختيار المعاملات الفائقة
    درجة      خرج متصل للنموذج، أو قيمة مقياس
    عتبة      قطع مطبَّق على الدرجة، اصطلاح 0,50، غير متعلَّم
    مرجع ساذج  حد دونه لا يقدّم النموذج شيئاً

قول الخلاصة

يُقرَأ نموذج مدرَّب على مستويين: المعاملات الفائقة، المثبتة قبل التعلّم، تحدّد عائلة الدوال المتاحة والطريقة التي سيُجرى بها البحث فيها؛ والمعاملات، الناتجة عن هذا البحث، تسمّي الدالة المحتفَظ بها نهائياً. وتُضبَط الأولى بمقارنة تدريبات متتالية على مجموعة تحقّق، لا أبداً على مجموعة الاختبار، التي تشكّل مراجعتها الوحيدة التقدير الوحيد غير المنحاز للأداء المتوقَّع.


اختبارات مرتبطة

  • 009.1-quiz-parametre-appris.md
  • 009.2-quiz-hyperparametre.md
  • 009.3-quiz-critere-de-distinction.md
  • 009.4-quiz-inspection-scikit-learn.md
  • 009.5-quiz-reglage-et-jeu-de-test.md
  • 009.6-quiz-capacite-biais-variance.md
  • 009.7-quiz-loss-metric-score-seuil-baseline.md

الفصل التالي: 010-classification-ou-regression.md