النموذج المدرَّب كائن عددي: إنه يتضمّن أعداداً. وهذه الأعداد ليست كلها من الطبيعة نفسها، وخلطها من أكثر الأخطاء شيوعاً في بداية الممارسة.
| الفئة | الأصل | تُثبَّت متى | من يقرر |
|---|---|---|---|
| معامل (parameter) | تحسبه إجراء الأمثلة | أثناء التدريب | الخوارزمية، انطلاقاً من البيانات |
| معامل فائق (hyperparameter) | يُرصَد قبل إطلاق التدريب | قبل التدريب | المهندس، أو إجراء بحث |
ميّز الفصل 008 الخوارزمية، وهي إجراء، عن النموذج، وهو نتيجة تطبيقها على مجموعة بيانات. وتضبط المعاملات الفائقة الإجراء؛ وتشكّل المعاملات النتيجة.
قراءة المخطط: تظهر المعاملات الفائقة في النموذج النهائي بمقام المعاملات نفسه، إذ تصف تكوينه، لكنها تصل إليه بمسار مختلف: لم تمر أبداً بإجراء الأمثلة.
تتدخل أربعة كائنات متميّزة في صنع كعكة، وهي تقابل حداً بحد كائنات التعلّم الآلي الأربعة.
الوصفة هي سلسلة العمليات الواجب إجراؤها: خلط، دمج، إدخال الفرن، إراحة. وهي توجد بمعزل عن أي كعكة خاصة. هذه هي الخوارزمية.
الضبطات قرارات تُتَّخذ قبل إدخال الفرن: فرن عند 180 °C، طهي 35 دقيقة، حجم القالب. يثبّتها الحلواني مسبقاً؛ ولا يُكتشَف أي منها أثناء الطهي، وكلها تشترطه. هذه هي المعاملات الفائقة.
ما يصبح عليه العجين أثناء الطهي — بنية اللب، تلوين القشرة، توزيع الرطوبة — لا يقرره أحد: إنه ينتج عن تفاعل المكوّنات والضبطات. هذه هي المعاملات المتعلَّمة.
الكعكة الخارجة من الفرن هي الكائن النهائي المحصَّل بتطبيق هذه الوصفة على هذه المكوّنات بهذه الضبطات. هذا هو النموذج.
ثلاث نتائج تُقرَأ مباشرة في التشبيه. فالمكوّنات نفسها
والوصفة نفسها تعطي كعكات مختلفة حسب الضبطات: ومن هنا
تحسين المعاملات الفائقة، المعالَج في الفصل 035. ولا توجد
حرارة صحيحة عالمياً، بل حرارة ملائمة لكعكة
وفرن: ولا يوجد كذلك max_depth أمثل في ذاته. وأخيراً،
لا تُحدَّد الحرارة الجيدة بتقديم الكعكة لهيئة
المسابقة ثم البدء من جديد: تتذوق الهيئة مرة واحدة، والتجارب تتم
على دفعات تجريبية. وهذا وضع مجموعة الاختبار، المطوَّر في الفقرة 6.
حد التشبيه: يمكن للحلواني فتح الفرن ورصد الطهي. أما تكوين المعاملات فليس قابلاً للرصد خطوة بخطوة بصورة قابلة للتفسير. ويصف التشبيه الأدوار، لا شفافية العملية.
التعريف الدقيق
مقدار داخلي لنموذج تُحدَّد قيمته بإجراء الأمثلة المطبق على بيانات التدريب، بهدف تقليل دالة هدف معرَّفة على هذه البيانات. ومجموعة المعاملات، المرمَّزة عادة θ، تحدّد دالة خاصة تحديداً أحادياً داخل عائلة الدوال التي تستطيع الخوارزمية تمثيلها.
الصياغة المجموعية
تعرّف الخوارزمية عائلة دوال مرشَّحة، تُدعى فضاء الفرضيات ويُرمَّز H. ويقوم التدريب على انتقاء عنصر h ∈ H. والمعاملات إحداثيات هذا العنصر في H.
ترجمة إلى اللغة اليومية
هذه الأعداد التي حسبها النموذج نفسه انطلاقاً من البيانات، و تشكّل جوهر ما احتفظ به. وهي التي ستُكتَب في ملف النموذج وتُحمَّل لحظة التنبؤ.
نقطة انتباه
لا معنى لمعامل إلا نسبة إلى مجموعة البيانات التي أنتجته. وإعادة تدريب الخوارزمية نفسها على عيّنة أخرى تنتج معاملات أخرى. فمعامل ليس إذن ثابتاً فيزيائياً: إنه تقدير، مصحوب بعدم يقين معاينة.
ينمذج الانحدار الخطي المتعدد الهدف كتركيب تآلفي للمتغيرات التوضيحية:
ŷ = b₀ + b₁·x₁ + b₂·x₂ + ... + b_p·x_pوالمعاملات المتعلَّمة هي المعاملات p من b₁ إلى والثابت b₀، أي p + 1 قيمة. ولا يُحفَظ أي مقدار آخر.
مثال رقمي — تقدير سعر مسكن
| المتغير | المعامل المتعلَّم | التفسير |
|---|---|---|
| ثابت (b₀) | 42 300 | سعر أساس بالدولار، كل المتغيرات معدومة |
| مساحة سكنية (م²) | 2 180 | كل م² إضافي يضيف 2 180 $ |
| عدد الغرف | 6 400 | كل غرفة إضافية تضيف 6 400 $ |
| عُمر العقار (سنوات) | −870 | كل سنة أقدمية تسحب 870 $ |
| المسافة إلى المركز (كم) | −3 150 | كل كم إضافي يسحب 3 150 $ |
النموذج كله في هذه الأعداد الخمسة. لمسكن 85 م²، ثلاث
غرف، اثنتا عشرة سنة، أربعة كيلومترات من المركز:
ŷ = 42 300 + 2 180×85 + 6 400×3 − 870×12 − 3 150×4 = 224 570 $.
نقطة انتباه: شرط «كل الأشياء الأخرى متساوية» يفترض أن المتغيرات يمكن أن تتغيّر مستقلة بعضها عن بعض، وهي فرضية نادراً ما تتحقّق. والتعدد الخطي معالَج في الفصل 045.
وفي الانحدار اللوجستي، البنية مطابقة، إذ يُحوَّل التركيب الخطي بدالة سيغمودية لإنتاج احتمال. وتبقى المعاملات المعاملات والثابت (الفصل 036).
التعريف الدقيق
في بيرسبترون متعدد الطبقات، يحسب كل عصبون في طبقة مجموعاً مرجَّحاً لمخارج الطبقة السابقة، مزيداً بحد ثابت، ثم يطبق دالة تنشيط غير خطية. ومعاملات المجموع المرجَّح هي الأوزان (weights)، والحد الثابت هو الانحياز (bias). والأوزان والانحيازات تشكّل كامل المعاملات المتعلَّمة للشبكة.
العدّ
لطبقة تستقبل m مدخلاً وتتضمّن n عصبوناً، عدد المعاملات هو m × n وزناً زائداً n انحيازاً.
ترجمة إلى اللغة اليومية
كل اتصال بين عصبونين يحمل عدداً، يقول الأهمية الممنوحة لما ينقله الاتصال. وكل عصبون يحمل إضافة عدداً يزيح عتبة إطلاقه.
نقطة انتباه اصطلاحية
لكلمة «انحياز» هنا معنى تقني صرف: إنه الحد الثابت لتحويل تآلفي. ولا يجب خلطه بالتحيز الإحصائي لموازنة التحيز–التباين (الفصل 032)، ولا بالتحيز المجتمعي لنموذج تمييزي (الفصل 080). ثلاثة مفاهيم متجانسة اللفظ، ثلاثة تعريفات منفصلة.
مثال رقمي — بيرسبترون متعدد الطبقات لدرجة انقطاع
العمارة: 20 متغيراً في المدخل، طبقتان خفيتان 64 ثم 32 عصبوناً، مخرج واحد.
| الانتقال | أوزان | انحيازات | المجموع |
|---|---|---|---|
| مدخل → طبقة 1 | 20 × 64 = 1 280 | 64 | 1 344 |
| طبقة 1 → طبقة 2 | 64 × 32 = 2 048 | 32 | 2 080 |
| طبقة 2 → مخرج | 32 × 1 = 32 | 1 | 33 |
| المجموع | 3 360 | 97 | 3 457 |
تتعلّم هذه الشبكة 3 457 عدداً. وعدد الطبقات وحجمها — أي
hidden_layer_sizes=(64, 32) — ليسا متعلَّمين: إنهما
معاملان فائقان، وهما اللذان يحددان عدد المعاملات الواجب
تعلّمها. فمعامل فائق يحكم إذن كمية المعاملات، وهو ما
يشكّل الرابط المباشر مع مفهوم القدرة، المعالَج في الفقرة 7.
ليس لشجرة قرار معامل ولا وزن. وما تتعلّمه ذو طبيعة تركيبية:
رؤية جزئية: المستويات الثلاثة الأولى للشجرة المحصَّلة فعلاً في الفقرة 5.3، اختُصرت منها شعبتان.
القيمة 32,50 لم يخترها محلّل: قيّمت الخوارزمية التقسيمات المرشَّحة على كل متغير واحتفظت بالذي يقلّل أكثر عدم نقاء العقدة. وهي متعلَّمة، بمقام معامل انحدار (الآلية مفصَّلة في الفصل 037). وما ثبّته المهندس هو إطار هذا البحث: عمق أقصى، عدد أدنى لورقة، معيار عدم نقاء.
التعريف الدقيق
في الصياغة الثنائية لآلة متجهات داعمة (Boser، Guyon و Vapnik، 1992؛ Cortes وVapnik، 1995)، يُعبَّر عن الحل كتركيب خطي لدوال نواة مقيَّمة على مجموعة جزئية من ملاحظات التدريب. والملاحظات التي معاملها الثنائي موجب صرفاً تُدعى متجهات داعمة: إنها الوحيدة التي تتدخل في دالة القرار.
ما يُتعلَّم
المعاملات الثنائية ، وهوية الملاحظات المحتفَظ بها كمتجهات داعمة، وثابت القرار. ومع نواة خطية، تُعاد تركيب هذه الكميات في متجه معاملات متجانس مع ذلك لنموذج خطي.
ترجمة إلى اللغة اليومية
يحتفظ النموذج بأمثلة التدريب الواقعة قرب الحد بين الفئات ويسند إليها وزناً؛ والأمثلة البعيدة لا تؤثّر في القرار.
نقطة انتباه
عدد المتجهات الداعمة نتيجة للتدريب، لا تعليمات أبداً.
وعدد قريب من عدد التدريب يشير إلى حد
شديد عدم الانتظام وخطر فرط تخصيص، غالباً مرتبط بـ gamma
كبير جداً (الفصل 041).
التعريف الدقيق
تُدعى طريقة غير وسيطية عندما لا يُحدَّ تعقيد الدالة المتعلَّمة بعدد معاملات ثابت مسبقاً، بل ينمو مع عدد بيانات التدريب. وتُدعى طريقة كسولة (lazy learning) عندما تؤجّل كل حساب تعميم إلى طلب التنبؤ.
التطبيق على أقرب k جيران
استدعاء fit() على KNeighborsClassifier لا يحسب أي معامل:
إنه يحفظ مجموعة التدريب ويبني أحياناً بنية
فهرسة. وما «يُتعلَّم» هو مجموعة البيانات نفسها: النموذج
لا يلخّص شيئاً، إنه يقارن الملاحظة الجديدة بالأمثلة المحتفَظ بها
لحظة الإجابة.
نقطة انتباه
غير وسيطي لا يعني «بلا معامل فائق». فعدد الجيران k ومترية المسافة والترجيح حاسمة (الفصل 040).
| النموذج | طبيعة المعاملات المتعلَّمة | العدد لحالة نموذجية |
|---|---|---|
| انحدار خطي، 20 متغيراً | معاملات + ثابت | 21 |
| انحدار لوجستي ثنائي، 50 متغيراً | معاملات + ثابت | 51 |
| انحدار لوجستي، 10 فئات، 100 متغير | مصفوفة معاملات + ثوابت | 1 010 |
شجرة قرار، max_depth=3 | متغيرات، عتبات، قيم أوراق | 15 عقدة منها 8 أوراق |
شجرة قرار، max_depth=10 | كذلك | 757 عقدة منها 379 ورقة |
غابة عشوائية، 300 شجرة، max_depth=6 | كذلك، مجمَّع على 300 شجرة | نحو 35 000 عقدة |
| بيرسبترون متعدد الطبقات (20، 64، 32، 1) | أوزان وانحيازات | 3 457 |
| SVM بنواة RBF، 4 000 ملاحظة | متجهات داعمة ومعاملات ثنائية | بضع مئات إلى بضعة آلاف |
| أقرب k جيران، 4 000 ملاحظة | مجموعة التدريب المحفوظة | 4 000 ملاحظة محتفَظ بها |
تستأنف صفوف «شجرة» و«غابة» القيم المقيسة في الفقرة 5. وهي توضّح واقعة مركزية: عدد المعاملات المتعلَّمة ليس خاصية للخوارزمية وحدها، إنه محدَّد معاً بالمعاملات الفائقة والبيانات.
التعريف الدقيق
مقدار يضبط خوارزمية التعلّم، تُثبَّت قيمته مسبقاً لتنفيذ إجراء الأمثلة ولا تعدّلها هذه. وتحدد المعاملات الفائقة فضاء الفرضيات المستكشَف، ودالة الهدف المقلَّلة فعلاً، والإجراء العددي المستعمَل و معيار توقفه.
الصياغة التشغيلية
معامل فائق متغير يجب أن تُعرَف قيمته حتى يتمكن التدريب من البدء، وقيمته لا تتغيّر عندما ينتهي التدريب.
ترجمة إلى اللغة اليومية
هذه الضبطات التي نكتبها بأنفسنا بين قوسي النموذج، قبل إطلاق التعلّم.
أصل البادئة
تشير البادئة «hyper-» إلى مستوى أعلى: هذه المقادير تقع فوق المعاملات، إذ تشترط الطريقة التي ستُحدَّد بها هذه الأخيرة.
نقطة انتباه — تجانس لفظي إحصائي
في الإحصاء البايزي، يشير «معامل فائق» إلى معامل قانون الاحتمال القبلي الحامل على معاملات النموذج. والمعنيان يتقاسمان فكرة المستوى الثاني نفسها، لكنهما لا يغطيان الكائنات نفسها. وفي سياق التعلّم الآلي التطبيقي، المعنى المعطى أعلاه هو السائد.
| الخوارزمية | المعامل الفائق | الدور | أثر الزيادة |
|---|---|---|---|
| انحدار لوجستي | C | مقلوب قوة التنظيم | تنظيم أضعف، معاملات أكثر حرية، قدرة متزايدة |
| انحدار لوجستي | penalty / l1_ratio | طبيعة الجزاء (L1، L2، مختلط) | L1 يلغي معاملات، L2 يقلّصها |
| Ridge، Lasso، ElasticNet | alpha | قوة التنظيم | معاملات أكثر تقييداً، قدرة منخفضة |
| شجرة قرار | max_depth | عمق أقصى | شجرة أعمق، قدرة متزايدة، فرط تخصيص محتمل |
| شجرة قرار | min_samples_leaf | عدد أدنى لورقة | أوراق أكثر ازدحاماً، شجرة أكثر انتظاماً، قدرة منخفضة |
| شجرة قرار | ccp_alpha | تكلفة تعقيد للتقليم | تقليم أشد، قدرة منخفضة |
| غابة عشوائية | n_estimators | عدد أشجار مجمَّعة | تباين تنبؤ منخفض، تكلفة حساب متزايدة |
| غابة عشوائية | max_features | متغيرات مرشَّحة لكل تقسيم | أشجار أكثر ارتباطاً فيما بينها، كسب التجميع منخفض |
| Gradient boosting | learning_rate | خطوة تقلّص كل شجرة | تعلّم أسرع، خطر فرط تخصيص متزايد |
| Gradient boosting | n_estimators | عدد تكرارات boosting | قدرة متزايدة، فرط تخصيص ممكن بلا توقف مبكر |
| Gradient boosting | subsample | كسر ملاحظات لكل تكرار | تنظيم عشوائي أقل عندما يميل إلى 1 |
| أقرب k جيران | n_neighbors (k) | عدد جيران مستشارين | حد أكثر نعومة، قدرة منخفضة |
| SVM | C | جزاء انتهاكات الهامش | هامش أضيق، ملاءمة أشد للبيانات |
| SVM | kernel، gamma | شكل الحد | gamma مرتفع: حد محلي جداً، فرط تخصيص |
| بيرسبترون متعدد الطبقات | hidden_layer_sizes | عمارة الشبكة | مزيد من معاملات للتعلّم، قدرة متزايدة |
| بيرسبترون متعدد الطبقات | alpha | تنظيم L2 للأوزان | أوزان أكثر تقييداً، قدرة منخفضة |
نقطة انتباه على C وalpha: يحكم هذان المعاملان الفائقان
الشيء نفسه — قوة التنظيم — لكن باتجاهين متعاكسين.
alpha متناسب مع قوة الجزاء؛ وC مقلوبه.
زيادة alpha تنظّم أكثر؛ وزيادة C تنظّم أقل. وهذا
العكس مصدر خطأ دائم في المقابلة التقنية.
التعريف الدقيق
يضيف التنظيم إلى دالة الخسارة حداً يجازي مقدار
المعاملات، لتقييد فضاء الحلول الجائزة. وتصبح
المسألة المحلولة تقليل
J(θ) = perte_sur_les_données(θ) + λ · pénalité(θ). ويعرض Ridge وLasso
λ مباشرة باسم alpha؛ ويعرض الانحدار اللوجستي وSVM
C، المعرَّف كمقلوب λ بثابت تقريباً.
ترجمة إلى اللغة اليومية
alpha فرامل: كلما كبر، قُيِّد النموذج أكثر. وC هو
إذن: كلما كبر، كان النموذج أكثر حرية في الالتصاق
بالبيانات.
نقطة انتباه
لا معنى للتنظيم إلا على متغيرات بمقياس قابل للمقارنة: مجازاة معاملات تحمل على وحدات متغايرة يعود إلى مجازاة بعض المتغيرات اعتباطياً. التوحيد في الفصل 023، والتنظيم في الفصل 047.
التعريف الدقيق
معامل جدائي مطبَّق على اتجاه تحديث المعاملات
في كل تكرار لأمثلة تكرارية: في نزول تدرّجي،
θ_(t+1) = θ_t − η · ∇J(θ_t)، حيث η يشير إلى معدّل التعلّم. وفي gradient
boosting، يُفسَّر الضبط نفسه كعامل تقلّص مطبَّق
على مساهمة كل مقدِّر مضاف.
ترجمة إلى اللغة اليومية
حجم الخطوة المنجَزة في كل تصحيح. خطوة كبيرة جداً تُفوِّت الحد الأدنى ويمكن أن تجعل التعلّم يتباعد؛ وخطوة صغيرة جداً لا تتقدم بسرعة كافية لميزانية التكرارات المتاحة.
نقطة انتباه
learning_rate وn_estimators مقترنان في boosting: قسمة معدّل
التعلّم على اثنين تفرض تقريباً مضاعفة عدد
التكرارات لبلوغ ملاءمة قابلة للمقارنة. فلا يجب إذن أبداً ضبط هذين المعاملين الفائقين
مستقلين أحدهما عن الآخر.
معالَج في الفصل 039.
ليست لكل المعاملات الفائقة المدى نفسه. وتصنيفها حسب الوظيفة يتجنّب ضبطها عشوائياً.
المعاملات الفائقة للقدرة حاسمة وتُضبَط بالأولوية؛ وتلك للأمثلة تثقل خصوصاً في boosting والشبكات العصبية؛ وتلك لبنية التجميع ذات مردود متناقص بسرعة؛ وتلك لمعالجة المسألة تصبح حرجة في سياق مختل أو بتكاليف خطأ غير متماثلة؛ وتلك للتنفيذ بلا أي أثر في التوقع على الأداء.
نقطة انتباه على random_state: هذا الوسيط معامل فائق شكلياً
— يُثبَّت قبل التدريب ولا يضبطه
الإجراء. ومع ذلك لا يجب أبداً إدراجه في بحث
تحسين. وانتقاء البذرة التي تعظّم درجة التحقّق
يعود إلى استغلال ضجيج المعاينة، لا إلى تحسين النموذج. والدور
المشروع لـ random_state هو قابلية إعادة الإنتاج.
سؤال واحد يفصل الفئتين، أيّاً كانت المكتبة أو الخوارزمية المستعمَلة:
هل يضبط هذا المقدار إجراء الأمثلة المنفَّذ أثناء
fit()، أم يُثبَّت قبل أن يبدأ هذا الإجراء؟
القاعدة المعيارية للمكتبة
في واجهة scikit-learn، يتجسّد التمييز في التسمية:
get_params()، وقابلة للتعديل بـ set_params()، و
اسمها لا يتضمّن لاحقة؛fit() تحمل اسماً ملحقاً بشرطة
سفلية: coef_، intercept_، feature_importances_،
classes_، tree_، estimators_، support_vectors_.النتيجة العملية
الوصول إلى سمة ملحقة قبل أي استدعاء لـ fit() يثير استثناء
NotFittedError. وهذا أسرع اختبار للحسم: سمة
لا توجد قبل التدريب متعلَّمة حتماً.
نقطة انتباه اصطلاحية
تُدعى الطريقة get_params() في حين أنها تعيد المعاملات الفائقة.
وهذا اختيار تسمية يعود إلى الاصطلاح العام للبرمجة، حيث
يشير «معامل» إلى وسيط دالة. وهو يغذي خلطاً
مؤسفاً مع الاصطلاح الإحصائي. وفي هذا المقرر، وفي المقابلة،
يحفظ «معامل» دائماً معناه الإحصائي: مقدار مقدَّر انطلاقاً
من البيانات.
| المقدار | الفئة | التبرير |
|---|---|---|
coef_ لانحدار لوجستي | معامل | يحسبه الحالّ لتقليل الخسارة |
C لانحدار لوجستي | معامل فائق | يجب أن يُعرَف قبل استدعاء الحالّ |
عتبة 32,50 على anciennete_mois في شجرة | معامل | ينتقيه بحث التقسيم |
max_depth لشجرة | معامل فائق | يحدّ البحث، وليس صادراً عنه |
feature_importances_ لغابة | معامل مشتق | محسوب انطلاقاً من البنية المتعلَّمة |
n_estimators لغابة | معامل فائق | يثبّت عدد الأشجار الواجب بناؤها |
max_iter لحالّ | معامل فائق | ميزانية ممنوحة قبل البدء |
n_iter_ لحالّ | نتيجة تنفيذ | عدد التكرارات المستهلكة فعلاً |
mean_ وscale_ لـ StandardScaler | معامل المحوِّل | مقدَّران على بيانات التدريب |
k لـ KNeighborsClassifier | معامل فائق | مثبت قبل، لا يحسّنه fit() أبداً |
| عدد المتجهات الداعمة المحصَّل | نتيجة تنفيذ | نتيجة للأمثلة الثنائية |
| عدد مكوّنات ACP | معامل فائق | مختار قبل؛ والمحاور نفسها متعلَّمة |
| عتبة قرار عند 0,50 | معامل فائق للقرار | اصطلاح افتراضي، غير صادر عن fit() |
random_state | معامل فائق للتنفيذ | مثبت قبل، لكن لا يجب تحسينه |
الحالة الحدّية 1 — إحصاءات معالِج مسبق. متوسط وانحراف
معياري لـ StandardScaler مقدَّران انطلاقاً من البيانات: إنهما
معاملان بمعنى إجراء fit()، حتى إن لم ينتميا إلى
النموذج التنبؤي. نتيجة حاسمة: يُقدَّران على مجموعة
التدريب وحدها ثم يُطبَّقان كما هما على المجموعات الأخرى. وتقديرهما على
مجموع البيانات يشكّل تسرّب معلومة (الفصل 028).
الحالة الحدّية 2 — التوقف المبكر. مع early_stopping=True، يُحدَّد عدد
التكرارات المحتفَظ به بالإجراء نفسه، برصد
الخسارة على مجموعة تحقّق داخلية. يبدو الحد ضبابياً؛ وهو
ليس كذلك. فقرار تفعيل التوقف المبكر وحجم هذه المجموعة
الداخلية والصبر والمقياس المراقَب تبقى معاملات فائقة مثبتة
مسبقاً؛ وعدد التكرارات المحتفَظ به نتيجة.
الحالة الحدّية 3 — المعاملات الفائقة المحسَّنة آلياً. أن يحدد
بحث على شبكة max_depth لا يحوّله إلى معامل:
البحث حلقة خارجية تعيد إطلاق تدريبات كاملة،
كل منها بقيمة مثبتة مسبقاً. ويُضبَط معامل داخل
تدريب، ويُختار معامل فائق بين عدة تدريبات
(الفصل 035).
الحالة الحدّية 4 — المعاملات المشتقة. feature_importances_ ليس
محسَّناً مباشرة: إنه إحصائية محسوبة بعدئذ انطلاقاً من
تقليلات عدم النقاء للبنية المتعلَّمة. وهو مع ذلك يندرج تحت
المقادير المتعلَّمة، إذ لا يوجد قبل fit() ويعتمد بالكامل
على البيانات. والملاحظة نفسها لـ coef_ لـ SVM خطي، المعاد تركيبه
انطلاقاً من المعاملات الثنائية.
get_params() مقابل coef_ وfeature_importances_تصف مجموعة بيانات العرض 4 000 زبون لمشغّل اتصالات،
بخمسة متغيرات توضيحية وهدف ثنائي a_resilie نسبة
موجباته 0,3795.
get_params()from sklearn.linear_model import LogisticRegression
from sklearn.preprocessing import StandardScaler
import pandas as pd, numpy as np
Xs = pd.DataFrame(StandardScaler().fit_transform(X), columns=X.columns)
lr = LogisticRegression(C=1.0, max_iter=1000, random_state=0)
lr.fit(Xs, y)
for k, v in sorted(lr.get_params().items()):
print(f"{k}: {v!r}")C: 1.0
class_weight: None
dual: False
fit_intercept: True
intercept_scaling: 1
l1_ratio: 0.0
max_iter: 1000
n_jobs: None
penalty: 'deprecated'
random_state: 0
solver: 'lbfgs'
tol: 0.0001
verbose: 0
warm_start: Falseالتفسير. تُعرَض أربعة عشر ضبطاً في حين أن ثلاثة فقط
رُصدت؛ والأحد عشر الأخرى القيم الافتراضية للمقدِّر.
وكلها كانت معروفة قبل fit() ولم يعدّل أي منها: استدعاء
ثان بعد التدريب يعيد القاموس نفسه.
نقطة انتباه على القيم الافتراضية. نموذج مُنشأ بلا
وسيط ليس نموذجاً «بلا معاملات فائقة»: إنه نموذج أخذت
كل معاملاته الفائقة قيمها الافتراضية، وهي
اصطلاحات مكتبة لا أمثلات. وC=1.0 ينظّم بالفعل
جوهرياً.
نقطة انتباه على الإصدارات. المخرج يأتي من scikit-learn 1.8،
حيث penalty قيد الإهمال لصالح l1_ratio، والقيمة
0.0 تشير إلى جزاء L2 صرف؛ وتعرض الإصدارات السابقة
penalty: 'l2'. والمعاملات الفائقة تنتمي إلى واجهة
مكتبة وتتطور معها؛ والمعاملات المتعلَّمة تندرج تحت
الصياغة الرياضية للنموذج ولا تغيّر اسمها.
coef_ وintercept_print(pd.Series(np.round(lr.coef_[0], 4), index=X.columns).to_string())
print("intercept_:", np.round(lr.intercept_, 4))
print("n_iter_:", lr.n_iter_)
print("classes_:", lr.classes_)anciennete_mois -0.8957
facture_mensuelle 0.5515
nb_appels_support 0.5829
satisfaction -0.7586
data_go_moyen -0.0216
intercept_: [-0.6809]
n_iter_: [6]
classes_: [0 1]التفسير. هذه الأعداد الستة — خمسة معاملات وثابت — تشكّل كامل ما تعلّمه النموذج، ولم يكتب المهندس أيها. والمتغيرات موحَّدة، فالمعاملات قابلة للمقارنة فيما بينها: تهيمن الأقدمية، واستهلاك البيانات ضئيل.
| المتغير | المعامل | نسبة الأرجحية | القراءة المهنية |
|---|---|---|---|
anciennete_mois | −0,8957 | 0,41 | انحراف معياري أقدمية إضافي يقسم أرجحية الإلغاء على 2,4 |
satisfaction | −0,7586 | 0,47 | انحراف معياري رضا إضافي يقسم الأرجحية على 2,1 |
nb_appels_support | +0,5829 | 1,79 | انحراف معياري مكالمات إضافي يضاعف الأرجحية بـ 1,8 |
facture_mensuelle | +0,5515 | 1,74 | أثر قابل للمقارنة، بالاتجاه نفسه |
data_go_moyen | −0,0216 | 0,98 | بلا أثر قابل للاستغلال |
نقطة انتباه. يحمل n_iter_ وclasses_ شرطة سفلية نهائية و
لا يوجدان إلا بعد fit()، دون أن يكونا من الطبيعة نفسها لـ coef_. وn_iter_
تشخيص تقارب: القيمة 6، الأدنى بكثير من الميزانية
max_iter=1000، تشير إلى تقارب بلا انقطاع. وقيمة مساوية لـ
max_iter ستشير إلى توقف باستنفاد الميزانية، إذن نموذج غير
متقارب.
from sklearn.tree import DecisionTreeClassifier, export_text
dt = DecisionTreeClassifier(max_depth=3, min_samples_leaf=50, random_state=0)
dt.fit(X, y)
print("noeuds:", dt.tree_.node_count, "profondeur:", dt.get_depth(),
"feuilles:", dt.get_n_leaves())
print(export_text(dt, feature_names=list(X.columns), decimals=2))
print(pd.Series(np.round(dt.feature_importances_, 4), index=X.columns).to_string())noeuds: 15 profondeur: 3 feuilles: 8
|--- anciennete_mois <= 32.50
| |--- satisfaction <= 2.50
| | |--- nb_appels_support <= 0.50
| | | |--- class: 1
| | |--- nb_appels_support > 0.50
| | | |--- class: 1
| |--- satisfaction > 2.50
| | |--- facture_mensuelle <= 59.15
| | | |--- class: 0
| | |--- facture_mensuelle > 59.15
| | | |--- class: 1
|--- anciennete_mois > 32.50
| |--- satisfaction <= 2.50
| | |--- nb_appels_support <= 1.50
| | | |--- class: 0
| | |--- nb_appels_support > 1.50
| | | |--- class: 1
| |--- satisfaction > 2.50
| | |--- facture_mensuelle <= 59.45
| | | |--- class: 0
| | |--- facture_mensuelle > 59.45
| | | |--- class: 0
anciennete_mois 0.4497
facture_mensuelle 0.1065
nb_appels_support 0.1156
satisfaction 0.3282
data_go_moyen 0.0000ما فُرض. قيمتان فقط، max_depth=3 و
min_samples_leaf=50. والعمق المحصَّل يساوي 3 بالضبط: القيد
نشط، وبدونه كانت الشجرة ستواصل النمو.
ما تُعلِّم. سبعة تقسيمات داخلية، كل منها معرَّف بزوج
(متغير، عتبة)، وثماني أوراق مع توزيع فئاتها. والقيم
32,50 و2,50 و59,15 و0,50 و1,50 و59,45 كلها صادرة عن
بحث التقسيم. وأن تُقطَع facture_mensuelle عند 59,15 في
شعبة وعند 59,45 في أخرى يبيّن أنها مقادير مقدَّرة
محلياً، لا عتبات مهنية.
الأهميات. feature_importances_ متجه مجموعه 1
يوزّع تقليل عدم النقاء الكلي بين المتغيرات. ويحصل data_go_moyen
على 0,0000: تحت قيد العمق هذا، لم يُحتفَظ بالمتغير
قط لتقسيم. فهذا الصفر لا يعني إذن «بلا رابط مع
الهدف» بل «لم يُنتقَ قط في هذه الشروط»؛ وعمق
أعلى سيسند إليه أهمية غير معدومة. حدود هذا المؤشر
في الفصل 080.
زوجان من الشعب الفرعية ينتهيان إلى الفئة المتنبَّأ بها نفسها. ومع ذلك احتُفظ بالتقسيم لأنه يقلّل عدم النقاء: فاحتمالات التنبؤ تختلف، حتى عندما تتطابق الفئة الأغلبية (الفصل 029).
for d in [2, 3, 5, 10, None]:
m = DecisionTreeClassifier(max_depth=d, random_state=0).fit(X, y)
print(f"max_depth={str(d):>4} -> noeuds={m.tree_.node_count:>5}"
f" feuilles={m.get_n_leaves():>5} acc_train={m.score(X, y):.4f}")max_depth= 2 -> noeuds= 7 feuilles= 4 acc_train=0.6980
max_depth= 3 -> noeuds= 15 feuilles= 8 acc_train=0.7202
max_depth= 5 -> noeuds= 63 feuilles= 32 acc_train=0.7445
max_depth= 10 -> noeuds= 757 feuilles= 379 acc_train=0.8498
max_depth=None -> noeuds= 2033 feuilles= 1017 acc_train=1.0000التفسير. معامل فائق وحيد ينقل النموذج من 7 إلى 2 033 عقدة متعلَّمة، أي عامل 290، وتتقدم دقة التدريب حتى 1,0000: تعزل الشجرة غير المقيَّدة كل ملاحظة. وهذه القيمة ليست نجاحاً بل حفظاً — على بيانات ضوضائية نسبة الموجبات فيها 0,38، لا يصنّف أي نموذج نزيه مجموعة تدريبه بكمال (الفصل 031).
for C in [0.001, 0.01, 0.1, 1.0, 100.0]:
m = LogisticRegression(C=C, max_iter=1000).fit(Xs, y)
print(f"C={C:<8} coef_={np.round(m.coef_[0], 3)} "
f"norme_L2={np.linalg.norm(m.coef_):.3f}")C=0.001 coef_=[-0.336 0.205 0.22 -0.283 -0.002] norme_L2=0.533
C=0.01 coef_=[-0.737 0.451 0.479 -0.623 -0.014] norme_L2=1.168
C=0.1 coef_=[-0.877 0.539 0.57 -0.742 -0.021] norme_L2=1.392
C=1.0 coef_=[-0.896 0.551 0.583 -0.759 -0.022] norme_L2=1.422
C=100.0 coef_=[-0.898 0.553 0.584 -0.76 -0.022] norme_L2=1.425التفسير. لا يظهر C أبداً في coef_ لكنه يحكم
مداه: تنتقل نظيم المعاملات من 0,533 إلى 1,425 عندما ينمو C
من 0,001 إلى 100. والتقليص منتظم ويحفظ ترتيب المتغيرات.
وبعد C=1، لا تتحرك المعاملات عملياً: أصبح الجزاء
ضئيلاً أمام حد الخسارة. واستكشاف C=10 000 سيكون
بلا أثر هنا، وهو ما يبرر الشبكات اللوغاريتمية المحدودة
(الفصل 035).
صياغة للحفظ: المعاملات الفائقة ليست في النموذج إلى جانب المعاملات، إنها القيود التي حُسبت تحتها المعاملات.
ضبط معامل فائق يفترض مقارنة عدة تدريبات و الاحتفاظ بالأفضل، وهو ما يتطلب مجموعة غير مستعمَلة لضبط المعاملات. والإغراء هو استعمال مجموعة الاختبار، إذ هي التي تحمل تقدير الأداء. وهذا بالضبط الاستعمال المحظور عليها.
كل قرار يُتَّخذ بالنظر إلى مجموعة بيانات ينقل معلومة من هذه المجموعة إلى النموذج. فتتوقف المجموعة عندئذ عن كونها غير مسبوقة، و تتوقف الدرجة التي تنتجها عن تقدير الأداء على بيانات جديدة.
| المجموعة | ما يُقرَّر فيها | عدد المراجعات | ما تقدّره درجتها |
|---|---|---|---|
| تدريب | معاملات النموذج | مرة لكل تدريب | القدرة على إعادة إنتاج البيانات المرئية، بلا قيمة تنبؤية |
| تحقّق | المعاملات الفائقة، الخوارزمية، العتبة، المتغيرات المحتفَظ بها | مرة لكل تكوين مجرَّب | أداء متفائل، منحاز بالانتقاء |
| اختبار | لا شيء | مرة واحدة فقط، في النهاية | الأداء المتوقَّع على بيانات جديدة |
الدرجة المحصَّلة على مجموعة منتهية مشوبة بتباين معاينة: على 800 ملاحظة تحقّق، الانحراف المعياري لدقة قريبة من 0,75 يساوي نحو 0,015. ومقارنة K تكويناً و الاحتفاظ بالحد الأقصى يعود إلى انتقاء، من بين K سحوبات ضوضائية، ذلك الذي ضجيجُه الأكثر مواتاة.
| التكوينات المقارنة | الفرق المتوقَّع بين الحد الأقصى المرصود والأداء الحقيقي |
|---|---|
| 1 | نحو 0,000 |
| 10 | نحو +0,023 |
| 50 | نحو +0,032 |
| 200 | نحو +0,040 |
تقابل أوامر الحجم هذه توقّع الحد الأقصى لـ K متغيرات غوسية متمركزة بانحراف معياري 0,015. والاستنتاج بنيوي ولا يعتمد على العناية المبذولة في المسلك: درجة التكوين المحتفَظ به متفائلة بالبناء. فمجموعة إضافية، بقيت خارج كل قرار، ضرورية إذن للحصول على تقدير غير منحاز.
إحالات: بناء المجموعات الثلاث معالَج في الفصل 026، و مخططات التجزئة الخاصة في الفصل 027، والتحقّق المتقاطع في الفصل 034، وإجراءات بحث المعاملات الفائقة في الفصل 035، و اختيار عتبة القرار في الفصل 062.
التعريف الدقيق
قياس ثراء عائلة الدوال التي تستطيع خوارزمية، مكوَّنة بطريقة معينة، تمثيلها. وهي مصاغة ببعد Vapnik-Chervonenkis (Vapnik وChervonenkis، 1971) — عدد أكبر مجموعة نقاط تستطيع العائلة فصلها حسب كل الوسوم الممكنة — أو بمقاييس قريبة مثل تعقيد Rademacher.
الدور الخاص لفئتي المقادير
المعاملات الفائقة تحدّد فضاء الفرضيات H؛ والمعاملات تنتقي عنصراً h داخل H. وزيادة القدرة هي توسيع H.
ترجمة إلى اللغة اليومية
إلى أي حد يمكن لنموذج أن يلازم شكل البيانات. قدرة غير كافية تمنعه من تمثيل الظاهرة؛ وقدرة مفرطة تتيح له ملازمة الضجيج أيضاً.
نقطة انتباه
القدرة ليست الأداء: تبلغ شجرة غير مقيَّدة دقة كاملة على التدريب ويمكن أن تكون متوسطة على بيانات جديدة (الفقرة 5.4).
| المعامل الفائق | زيادة قيمته | القدرة | الخطر المهيمن إن دُفع إلى الطرف |
|---|---|---|---|
max_depth | شجرة أعمق | تزيد | فرط تخصيص |
min_samples_leaf | أوراق أكثر ازدحاماً | تنقص | نقص تخصيص |
alpha (Ridge، Lasso، MLP) | جزاء أقوى | تنقص | نقص تخصيص |
C (لوجستي، SVM) | جزاء أضعف | تزيد | فرط تخصيص |
n_neighbors (k) | جوار أوسع | تنقص | نقص تخصيص |
hidden_layer_sizes | شبكة أوسع أو أعمق | تزيد | فرط تخصيص |
gamma (نواة RBF) | تأثير أكثر محلية | تزيد | فرط تخصيص بارز |
learning_rate (boosting) | خطوة أكبر | تزيد عند ميزانية تكرارات ثابتة | فرط تخصيص |
n_estimators (غابة عشوائية) | مزيد من أشجار مجمَّعة | يثبّت التباين | تكلفة حساب، بلا تدهور ملحوظ |
نقطة انتباه على n_estimators. الصف الأخير استثناء.
في غابة عشوائية، زيادة عدد الأشجار تقلّل تباين
المجمَّع بلا زيادة فرط التخصيص، بمردود متناقص بسرعة.
وفي boosting، يصحّح كل تكرار بواقي
السابقة: يزيد n_estimators القدرة ويجب تقييده،
بتوقف مبكر أو بتحقّق. فتسمية واحدة تغطي إذن
سلوكين متعاكسين حسب عائلة الخوارزميات.
الموازنة. قدرة غير كافية تنتج خطأ منهجياً، التحيز: يفشل النموذج على التدريب كما على الاختبار. و قدرة مفرطة تنتج حساسية لمجموعة التدريب الخاصة، التباين: ينجح النموذج على التدريب ويفشل على بيانات جديدة. وضبط المعاملات الفائقة للقدرة يعود إلى التحكيم بين هذين النظامين. موازنة التحيز–التباين في الفصل 032، وفرط التخصيص و نقص التخصيص في الفصل 031، وروافع التصحيح في الفصل 033.
تُقدَّم هذه المفاهيم الخمسة هنا لأنها لا تنفصل عن التمييز السابق: الخسارة ما تقلّله الأمثلة لإنتاج المعاملات، والمقياس ما يقارنه التحقّق لاختيار المعاملات الفائقة، والعتبة والمرجع الساذج قراران هندسيان لا يتعلّم شيئاً. وكل منها معالَج بعمق لاحقاً.
التعريف الدقيق
دالة ℓ(y, ŷ) تربط زوجاً مكوَّناً من قيمة مرصودة و قيمة متنبَّأ بها بعدد حقيقي موجب يقيس تكلفة الفرق. ومتوسطها على مجموعة التدريب يشكّل الخطر التجريبي، الكمية المقلَّلة فعلاً بإجراء الأمثلة. ويُتحدَّث بلا تمييز عن دالة تكلفة أو دالة هدف أو معيار.
ترجمة إلى اللغة اليومية
قياس الخطأ الذي يسعى النموذج إلى تقليله أثناء تعلّمه. هذه النقاط المفقودة، ويقوم التعلّم على فقد أقل ما يمكن منها.
القيد التقني
يجب أن تكون دالة خسارة قابلة للأمثلة بالإجراء المستعمَل: غالباً قابلة للاشتقاق، أو على الأقل قابلة للتفكيك إلى معايير محلية، وهو ما يستبعد معظم مقاييس المجال.
نقطة انتباه
تُحسَب الخسارة على مجموعة التدريب أثناء التعلّم. و خسارة ضعيفة على التدريب لا تخبر شيئاً عن التعميم. و مقارنة خسائر التدريب والتحقّق معالَجة في الفصل 030.
| المهمة | الخسارة المعتادة | ما تجازيه |
|---|---|---|
| انحدار | خطأ تربيعي متوسط (MSE) | مربع الفرق، إذن بقوة الفروق الكبيرة |
| انحدار متين | خطأ مطلق (MAE)، خسارة Huber | خطياً، إذن أقل حساسية للقيم المتطرفة |
| تصنيف احتمالي | إنتروبيا متقاطعة، log loss | الثقة الممنوحة لتنبؤ خاطئ |
| SVM | خسارة مفصلية (hinge) | انتهاكات الهامش |
| تقسيم شجرة | عدم نقاء جيني، إنتروبيا | تغاير الفئات في عقدة |
التعريف الدقيق
مقدار محسوب انطلاقاً من تنبؤات نموذج والقيم المرصودة، موجَّه لتوصيف أدائه بهدف مقارنة أو قرار. ولا يتدخل في أمثلة المعاملات ولا يخضع لأي قيد قابلية اشتقاق.
ترجمة إلى اللغة اليومية
الرقم الذي نقدّمه لنقول إن النموذج جيد، وحسب أي معيار.
التمييز عن الخسارة
الخسارة تخدم التعلّم، والمقياس يخدم الحكم. ويمكن لمصنِّف أن يقلّل الإنتروبيا المتقاطعة وهو يُقيَّم بالاستدعاء: إنهما مقداران مختلفان محسوبان على التنبؤات نفسها.
نقطة انتباه
ينحاز المقياس إلى الرهان المهني، لا إلى التسهيل الرياضي. واختيار المقياس معالَج في الفصول 052 إلى 075، والمبدأ الموجِّه للمقرر مذكَّر به في الفصل 075: السؤال ليس أي مقياس الأفضل، بل أي خطأ يكلف أكثر.
| المعيار | دالة الخسارة | مقياس التقييم |
|---|---|---|
| الغاية | توجيه الأمثلة | التوصيف والتواصل |
| المستعمِلة | إجراء fit() | المهندس ومتخذ القرار المهني |
| القيد | قابل للأمثلة، عموماً قابل للاشتقاق | لا شيء |
| لحظة الحساب | في كل تكرار للتدريب | بعد التنبؤ، على مجموعة محجوزة |
| أمثلة | MSE، log loss، hinge، Gini | دقة، دقة موجبة، استدعاء، F1، AUC، MAE، R² |
| يختاره | مفروض إلى حد كبير بالخوارزمية | المهندس، حسب تكلفة الأخطاء |
طالب يراجع لامتحاناً. سلم التنقيط يقول له كم نقطة يفقد على كل نوع خطأ: هذا ما يسعى إلى تقليله بالعمل. هذه دالة الخسارة.
والتقدير الموضوع على كشفه — مقبول، جيد، جيد جداً — هو ما سينظر إليه صاحب العمل. هذا المقياس.
ويُحسَبان على النسخة نفسها ولا يتطابقان: نسختان فقدتا العدد نفسه من النقاط يمكن أن تتلقيا تقديرات مختلفة حسب توزيع الأخطاء بين الاختبارات.
وتحسين السلم دون النظر أبداً إلى التقدير خطأ منهجي شائع: نموذج تنقص خسارته بانتظام يمكن أن يرى مقياسه المهني يركد أو يتدهور.
التعريف الدقيق
يغطي المصطلح معنيين متميّزين يجب عدم خلطهما أبداً.
المعنى 1 — درجة خرج النموذج. قيمة متصلة ينتجها
النموذج لملاحظة، قبل أي قرار: احتمال مقدَّر
يعيده predict_proba()، أو قيمة غير معايرة يعيدها
decision_function(). ودرجة ليست فئة.
المعنى 2 — درجة أداء. قيمة عددية لمقياس
تقييم على مجموعة بيانات. وهذا معنى model.score(X, y) في
scikit-learn، الذي يعيد الدقة لمصنِّف ومعامل
التحديد R² لمنحدر.
اصطلاح scikit-learn
تتبع دوال التقييم قاعدة «الأكبر أفضل». فمقاييس
الخطأ، الواجب تقليلها، تُعرَض إذن على شكل
سالب: neg_mean_squared_error، neg_log_loss. وقيمة سالبة
يعرضها بحث على شبكة ليست شذوذاً.
نقطة انتباه
الإعلان «درجة النموذج 0,91» بلا أي قيمة إعلامية ما لم يُسمَّ المقياس ومجموعة البيانات.
التعريف الدقيق
قيمة قطع مطبَّقة على الدرجة المتصلة التي ينتجها مصنِّف لتحويل هذه الدرجة إلى قرار متقطع. ولمسألة ثنائية، تُسنَد الملاحظة إلى الفئة الموجبة عندما تكون الدرجة المقدَّرة أعلى من العتبة أو مساوية لها.
ترجمة إلى اللغة اليومية
من أي مستوى احتمال نقرر الفعل.
الوضع بالنظر إلى الفصل
العتبة ليست متعلَّمة. والقيمة 0,50 اصطلاح افتراضي، لا أمثل. والعتبة معامل فائق للقرار، يُضبَط على مجموعة تحقّق، لا أبداً على مجموعة الاختبار.
نقطة انتباه
خفض العتبة يزيد عدد الموجبات المتنبَّأ بها، إذن الاستدعاء، على حساب الدقة الموجبة؛ ورفعها ينتج الأثر المعاكس. والضبط يندرج تحت موازنة اقتصادية بين تكلفة موجب كاذب وتكلفة سالب كاذب. معالَج في الفصلين 029 و062.
التعريف الدقيق
نموذج مرجعي تافه عمداً، يخدم حداً أدنى يُقارَن به كل نموذج مرشَّح. وأداؤه يشكّل العتبة التي دونها لا يقدّم نموذج متعلَّم أي قيمة.
مراجع معتادة
| المهمة | مرجع ساذج | التنفيذ |
|---|---|---|
| تصنيف | التنبؤ منهجياً بالفئة الأغلبية | DummyClassifier(strategy="most_frequent") |
| تصنيف | سحب عشوائي حسب التواترات المرصودة | DummyClassifier(strategy="stratified") |
| انحدار | التنبؤ بمتوسط الهدف | DummyRegressor(strategy="mean") |
| انحدار | التنبؤ بوسيط الهدف | DummyRegressor(strategy="median") |
| سلاسل زمنية | إعادة آخر قيمة مرصودة | نموذج استمرار |
| سياق صناعي | القاعدة المهنية حالياً في الإنتاج | إعادة تنفيذ القاعدة القائمة |
ترجمة إلى اللغة اليومية
قبل الجزم بأن نموذجاً ذو أداء، يجب التحقّق من أنه يفعل أفضل من استراتيجية حمقاء.
نقطة انتباه
على مجموعة مختلة بـ 2 % موجبات، يبلغ المرجع الساذج «فئة أغلبية» 98 % دقة بلا أي تعلّم. فدقة 97 % معلَنة لنموذج معقَّد تشكّل عندئذ تراجعاً. وهذا سبب بدء كل تقييم بحساب المرجع. معالَج في الفصلين 049 و050.
| المفهوم | الدور في السلسلة | من يحدده | فصل المعالجة |
|---|---|---|---|
| دالة خسارة | توجّه ضبط المعاملات | مفروضة بالخوارزمية، قابلة للتكوين أحياناً | 030 |
| مقياس | يقارن النماذج والتكوينات | المهندس، حسب الرهان المهني | 052 إلى 075 |
| درجة | خرج متصل، أو قيمة مقياس | النموذج، أو المقياس المختار | 029، 061، 063 |
| عتبة | تحوّل درجة إلى قرار | المهندس، على مجموعة تحقّق | 062، 088 |
| مرجع ساذج | يثبّت حد القيمة المضافة | المهندس، قبل أي نمذجة | 049 |
تعبير «ضبطت نموذجي بـ max_depth يساوي 5» غامض
وتغذي الطريقة get_params() الخلط، إذ تعيد
في الواقع المعاملات الفائقة. واصطلاح البرمجة و
اصطلاح الإحصاء يتباعدان هنا.
الصياغة الصحيحة: «ثبّتُ المعامل الفائق max_depth عند 5. و
معاملات النموذج هي العتبات وبنية الشجرة، التي
حددها التدريب.»
لا قيمة معامل فائق أمثل في ذاتها. والقيمة الملائمة تعتمد على العدد وعدد المتغيرات ومستوى الضجيج وبنية الظاهرة. وقيمة مستأنفة من تدوينة أو مشروع سابق فرضية انطلاق، لا ضبطاً.
الصياغة الصحيحة: «تبيّن أن max_depth=5 أفضل موازنة
على مجموعة البيانات هذه، إثر بحث مُصادَق عليه بتحقّق
متقاطع.»
يجب أن تبقى مجموعة الاختبار بمعزل عن كل قرار. وما إن يُقارَن تكوين فيها بآخر، فإنها تمارس وظيفة مجموعة تحقّق وتصبح الدرجة النهائية متفائلة. والتلوث تدريجي ولا ينتج أي إشارة تنبيه.
الصياغة الصحيحة: «انتُقيت المعاملات الفائقة بتحقّق متقاطع على مجموعة التدريب. ولم تُراجَع مجموعة الاختبار إلا مرة واحدة، للتقدير النهائي.»
متوسط وانحراف معياري لـ StandardScaler، والصيغ التي يحتفظ بها
مرمِّز، وقيم الإسناد مقدَّرة انطلاقاً من البيانات. وحسابها
على مجموع المجموعة قبل التجزئة ينقل معلومة من
الاختبار إلى التدريب.
الصياغة الصحيحة: «هذه الإحصاءات مقادير متعلَّمة. وهي تُقدَّر على مجموعة التدريب وحدها، داخل خط أنابيب، و تُطبَّق بعدئذ على المجموعات الأخرى.» معالَج في الفصلين 028 و076.
خسارة تدريب تنقص بانتظام لا تضمن لا التعميم، ولا رضا المعيار المهني. والمقداران يجيبان عن غايتين مختلفتين ويمكن أن يتطورا باتجاهين متعاكسين.
الصياغة الصحيحة: «يقلّل النموذج الإنتروبيا المتقاطعة أثناء التدريب؛ ويُقيَّم بالاستدعاء، لأن تكلفة سالب كاذب تهيمن في حالة الاستعمال هذه.»
تبلغ شجرة غير مقيَّدة دقة 1,0000 على بيانات تدريبها، كما تبيّن الفقرة 5.4. وهذه القيمة تقيس حفظاً، لا قدرة على التعميم. وبعد مستوى معين من القدرة، يزيد الخطأ على بيانات جديدة.
الصياغة الصحيحة: «بعد مستوى معين من القدرة، يلائم النموذج ضجيج مجموعة التدريب؛ فيتدهور خطأ التعميم في حين يواصل خطأ التدريب الانخفاض.»
البذرة العشوائية مثبتة قبل التدريب، وهو ما يجعلها شكلياً معاملاً فائقاً، لكنها لا تحمل أي معلومة عن الظاهرة. والاحتفاظ بالبذرة التي تعظّم درجة التحقّق يعود إلى انتقاء ضجيج وينتج كسباً لن يتكرر.
الصياغة الصحيحة: «يُثبَّت random_state لضمان
قابلية إعادة الإنتاج. وحساسية النموذج للبذرة تُقاس، ولا
تُحسَّن.»
يطبق predict() اصطلاحاً افتراضياً. وينتج النموذج درجة
متصلة؛ والمكتبة، لا التعلّم، هي التي تقطعها عند 0,50.
الصياغة الصحيحة: «العتبة قرار هندسي، مضبوط على مجموعة تحقّق حسب التكلفة الخاصة للموجبات الكاذبة و السوالب الكاذبة.»
الفئتان
معامل متعلَّم بإجراء الأمثلة، أثناء fit()
معاملات، أوزان وانحيازات، عتبات وبنية شجرة،
معاملات ثنائية ومتجهات داعمة
معامل فائق يثبّته المهندس، قبل fit()
max_depth, n_estimators, k, learning_rate, alpha, C
معيار التمييز الوحيد
هل يضبط هذا المقدار إجراء الأمثلة،
أم كان يجب أن يُعرَف حتى يبدأ هذا الإجراء؟
اصطلاح SCIKIT-LEARN
get_params() -> المعاملات الفائقة
attribut_ (شرطة سفلية) -> المقادير المتعلَّمة
coef_, intercept_, feature_importances_, tree_, support_vectors_
قبل fit()، هذه السمات لا توجد: NotFittedError.
التشبيه المرجعي
وصفة = خوارزمية
ضبطات الفرن = معاملات فائقة
ما يصبح عليه العجين = معاملات متعلَّمة
كعكة = نموذج
ما تحكمه المعاملات الفائقة
القدرة max_depth, C, alpha, k, hidden_layer_sizes
الأمثلة learning_rate, solver, max_iter, tol
بنية التجميع n_estimators, max_features, subsample
معالجة المسألة class_weight, criterion, عتبة
التنفيذ n_jobs, verbose, random_state
القدرة
المعاملات الفائقة تحدّد فضاء الفرضيات H.
المعاملات تنتقي عنصراً h في H.
قدرة ضعيفة جداً -> تحيز مرتفع، نقص تخصيص.
قدرة قوية جداً -> تباين مرتفع، فرط تخصيص.
قاعدة البروتوكول
تدريب -> يضبط المعاملات
تحقّق -> يختار المعاملات الفائقة والعتبة
اختبار -> يقدّر الأداء، يُراجَع مرة واحدة فقط
مجموعة يُقرَّر عليها تتوقف عن كونها مجموعة تقييم.
المفردات المرتبطة
خسارة ما تقلّله الأمثلة لإنتاج المعاملات
مقياس ما نقارنه لاختيار المعاملات الفائقة
درجة خرج متصل للنموذج، أو قيمة مقياس
عتبة قطع مطبَّق على الدرجة، اصطلاح 0,50، غير متعلَّم
مرجع ساذج حد دونه لا يقدّم النموذج شيئاًقول الخلاصة
يُقرَأ نموذج مدرَّب على مستويين: المعاملات الفائقة، المثبتة قبل التعلّم، تحدّد عائلة الدوال المتاحة والطريقة التي سيُجرى بها البحث فيها؛ والمعاملات، الناتجة عن هذا البحث، تسمّي الدالة المحتفَظ بها نهائياً. وتُضبَط الأولى بمقارنة تدريبات متتالية على مجموعة تحقّق، لا أبداً على مجموعة الاختبار، التي تشكّل مراجعتها الوحيدة التقدير الوحيد غير المنحاز للأداء المتوقَّع.
اختبارات مرتبطة
009.1-quiz-parametre-appris.md009.2-quiz-hyperparametre.md009.3-quiz-critere-de-distinction.md009.4-quiz-inspection-scikit-learn.md009.5-quiz-reglage-et-jeu-de-test.md009.6-quiz-capacite-biais-variance.md009.7-quiz-loss-metric-score-seuil-baseline.mdالفصل التالي: 010-classification-ou-regression.md