الخوارزمية، النموذج، التدريب والتنبؤ

19 دقيقة
الكتلة 1 — المفردات الأساسية
الهدف
تعريف خوارزمية التعلّم والنموذج بدقة، وإرساء التمييز الصارم بينهما، وتوصيف التدريب بوصفه إجراء اختيار في فضاء فرضيات والتنبؤ بوصفه تقييم دالة، وتحديد ما يُصدَّر فعلاً ويُسلسَل ويُنشَر في الإنتاج.
المدة المقدَّرة
35 دقيقة
المتطلبات السابقة
الفصول 001 إلى 007
الاختبارات المرتبطة
من 008.1-quiz-algorithme-apprentissage.md إلى 008.6-quiz-cycle-complet.md

1. خوارزمية التعلّم

1.1 مشكلة المفردات

تُلاحَظ الأقوال الأربعة التالية عادة في تقارير المشاريع. ثلاثة منها خاطئة.

القولالوضعالسبب
«درّبنا Random Forest على 40 000 ملاحظة.»مقبولحذف مقبول: التدريب بـ خوارزمية Random Forest
«تتنبأ الخوارزمية باحتمال إلغاء يبلغ 0,72.»خاطئالخوارزمية لا تتنبأ؛ النموذج ينتج التنبؤ
«نشرنا XGBoost في الإنتاج.»خاطئما يُنشَر نموذج صادر عن XGBoost، لا المكتبة
«تعلّمت الخوارزمية أن الأقدمية تقلّل المخاطر.»خاطئتنفّذ الخوارزمية إجراءً؛ والمعلومة المتعلَّمة تقيم في معاملات النموذج

الفجوة ليست معجمية صرفاً: ما يُصدَّر، وما هو قابل لإعادة الإنتاج، وما يجب إعادة تنفيذه عندما تتطوّر البيانات وما يُنقَل إلى الاستغلال ليست الكائنات نفسها حسب ما نتحدث عن الخوارزمية أو النموذج (الفقرة 3).

1.2 التعريفات

تعريف — الخوارزمية، بالمعنى العام

التعريف الدقيق. تتابع منتهٍ وغير غامض من العمليات الأولية يتيح، انطلاقاً من مدخلات تنتمي إلى مجال محدَّد، إنتاج مخرج في عدد منتهٍ من الخطوات. يحتفظ التوصيف الكلاسيكي بخمس خصائص (Knuth، The Art of Computer Programming، 1968): الانتهاء، تعريف غير غامض لكل خطوة، مدخلات محدَّدة، مخرجات محدَّدة، فعالية العمليات.

ترجمة إلى اللغة اليومية. طريقة مكتوبة مرة واحدة وإلى الأبد، تصف ما يجب فعله وبأي ترتيب، مستقلة عن القيم التي ستُنفَّذ عليها.

نقطة انتباه. الخوارزمية وصف إجراء: لا تملك حالة، ولا تحتوي أي معرفة عن مجال خاص ولا تتغيّر عندما تتغيّر البيانات.

تعريف — خوارزمية التعلّم (learning algorithm، learner)

التعريف الدقيق. حالة خاصة من السابق: إجراء يُطبَّق على مجموعة بيانات D = {(x₁, y₁), …, (xₙ, yₙ)} وعلى تكوين معاملات فائقة λ، ويختار عنصراً ĥ من فضاء فرضيات H وفق معيار صريح مقيَّم على D. شكلياً، A : (D, λ) ⟼ ĥ ∈ H.

ترجمة إلى اللغة اليومية. الطريقة التي، انطلاقاً من جدول أمثلة موسومة سلفاً، تصنع قاعدة القرار. تصف كيف نبحث، لا ما سيُعثَر عليه. يجب تسمية ثلاثة عناصر حتى تُحدَّد: فضاء الفرضيات الممسوح (الفقرة 1.3)، والمعيار المقيَّم على البيانات، واستراتيجية البحث (الفقرة 4.2).

نقطة انتباه. الخوارزمية متطابقة لكل المشاريع التي تستخدمها: RandomForestClassifier هو نفسه لدى كل مستخدمي نسخة معيّنة من scikit-learn. وما يختلف من مشروع إلى آخر هو النموذج المنتَج، لا الخوارزمية أبداً.

1.3 فضاء الفرضيات والانحياز الاستقرائي

تعريف — فضاء الفرضيات (hypothesis space، H)

التعريف الدقيق. مجموعة H لكل الدوال المرشَّحة h : X → Y التي تكون الخوارزمية بنيوياً قادرة على إنتاجها، حيث X فضاء المتغيرات التوضيحية و Y فضاء المتغير الهدف. تُحدَّد H مشتركاً بعائلة الدوال المحتفَظ بها وبالمعاملات الفائقة التي تقيّد شكلها: تثبيت max_depth=3 لا يعدّل الخوارزمية، بل يقيّد H بالأشجار ذات عمق 3 على الأكثر.

ترجمة إلى اللغة اليومية. مجموعة كل القواعد التي يحق للطريقة صنعها: لن تنتج أبداً قاعدة غائبة عن هذه المجموعة، أيّاً كانت كمية البيانات المقدَّمة. لانحدار خطي بمتغيرين، H هي مجموعة الدوال h(x) = β₀ + β₁x₁ + β₂x₂، ذات أصل لانهائي لكن معلَّمة بثلاثة أعداد حقيقية؛ ولا تتيح أي مجموعة بيانات إنتاج دالة درج أو دورية فيها.

نقطة انتباه. يقصر نموذج لأسباب متميّزة: الدالة الصحيحة لا تنتمي إلى H (خطأ تقريب، مرتبط باختيار الخوارزمية)، أو تنتمي إليها دون أن تُعثَر (خطأ تقدير، مرتبط بالبيانات والتحسين) — الفصل 032.

تعريف — الانحياز الاستقرائي (inductive bias)

التعريف الدقيق (Mitchell، 1980). مجموعة الفرضيات الإضافية، غير القابلة للاشتقاق من بيانات التدريب، التي تحشدها خوارزمية لتفضيل بعض التعميمات على أخرى من بين تلك المتوافقة مع البيانات الملاحَظة. يتجلّى بشكلين: تقييد فضاء الفرضيات والتفضيل داخل H، مثلاً للفرضية الأبسط عند تساوي الأداء.

ترجمة إلى اللغة اليومية. مجموعة أمثلة لا تحدّد أبداً قاعدة واحدة: لانهاية من القواعد تمرّ بالنقاط نفسها. والانحياز الاستقرائي هو مجموعة التفضيلات المدمجة في الطريقة، التي تفصل بين هذه القواعد.

النتيجة المرتبطة (Wolpert، 1996 — No Free Lunch). متوسطاً على مجموع كل المشاكل الممكنة، لا خوارزمية متفوّقة على أخرى: أداؤها على مشكلة معيّنة يأتي من ملاءمة انحيازها الاستقرائي وبنية الظاهرة الحقيقية. فاختيار خوارزمية رهان إذن على هذه البنية (الفصل 049).

نقطة انتباه. تعلّم بلا انحياز استقرائي مستحيل: خوارزمية خالية من أي تفضيل لا تستطيع أن تؤكد شيئاً عن ملاحظة غائبة عن مجموعة التدريب.

1.4 العائلات الرئيسية للخوارزميات

الخوارزميةفضاء الفرضيات Hشكل فرضيةالانحياز الاستقرائي الرئيسي
انحدار خطيدوال تآلفية لـ Xمجموع مرجَّح للمتغيراتخطية وإضافية الآثار
انحدار لوجستيلوجستيات دوال تآلفيةسيغمويد تركيب خطيحدود قرار خطية
شجرة قرار (CART)تجزئات X بقطع متعامدة مع المحاورتتابع اختبارات عتبة، ثابتة لكل ورقةقطع موازية للمحاور، تفضيل للأشجار القصيرة
أقرب k جيراندوال ثابتة حسب الجوارتصويت أو متوسط محلياستمرارية محلية: ملاحظتان قريبتان لهما هدفان قريبان
Naive Bayesتوزيعات شرطية محلَّلة عاملياًجداء معقوليات حسب المتغيراستقلال شرطي للمتغيرات علماً بالفئة
مدرك متعدّد الطبقاتتراكيب تطبيقات تآلفية ولاخطياتمخطط حساب بطبقاتقابلية التركيب وانتظام الدوال القابلة للتمثيل

القراءة: كل سطر يصف رهاناً مختلفاً على بنية الظاهرة. أثر عتبة بارز سيُخدَم سيئاً بانحدار خطي وجيداً بشجرة؛ وظاهرة إضافية وملساء، العكس.


2. النموذج بوصفه أثراً معلَّماً

2.1 التعريف

تعريف — النموذج (model، نموذج مدرَّب، fitted model)

التعريف الدقيق. عنصر ĥ ∈ H تختاره الخوارزمية A في نهاية تنفيذها على مجموعة بيانات D بمعاملات فائقة λ. ويُحدَّد النموذج بالكامل بمكوّنين: بنية — الشكل الدالي، تثبّته A و λ — ومجموعة قيم معاملات مضبوطة انطلاقاً من D.

التعريف التشغيلي. أثر برمجي ينفّذ دالة حتمية من المتغيرات التوضيحية نحو فضاء المخرج، يعتمد سلوكه بالكامل على مجموعة البيانات التي ضُبِط عليها، ويمكن تسلسله وتصديره ونقله وتقييمه مستقلاً عن الإجراء الذي أنتجه.

ترجمة إلى اللغة اليومية. نتيجة التدريب: قاعدة قرار ثابتة، في الذاكرة أو في ملف، تجيب على سؤال دقيق لملاحظة معيّنة.

نقطة انتباه. النموذج ليس الملف: هذا الأخير ليس إلا دعامة تسلسل، بقدر ما ليست المدوّنة الموسيقى. و النموذج نفسه يُصدَّر بـ joblib أو ONNX أو PMML دون تغيير طبيعته.

2.2 البنية والمعاملات

عائلة النماذجالبنية التي تثبّتها الخوارزمية و λالمعاملات المضبوطة على البياناتأمر الحجم
انحدار خطي بـ p متغيراًمعادلة تآلفيةp معاملاً وثابتp + 1
انحدار لوجستي بـ p متغيراًمعادلة تآلفية مركَّبة بلوجستيةp معاملاً وثابتp + 1
شجرة قرارشجرة ثنائية بعمق محدودمتغير وعتبة كل عقدة، قيمة كل ورقة10¹ إلى 10³
غابة عشوائية من 200 شجرة200 شجرة مجمَّعة بتصويت أو متوسطكل معاملات الأشجار الـ 20010⁴ إلى 10⁷
أقرب k جيرانمقياس ومقدار صحيح kلا شيء بالمعنى الدقيق: تُحفَظ مجموعة التدريبn × p قيمة مخزَّنة
مدرك متعدّد الطبقاتعدد الطبقات، العروض، التفعيلاتأوزان وانحيازات كل الوصلات10³ إلى 10¹¹

نقطة انتباه — أقرب k جيران. لا تنتج هذه الخوارزمية معاملات بالمعنى المعتاد: تحفظ ملاحظات التدريب وتؤجّل كل الحساب إلى لحظة التنبؤ (نموذج كسول، lazy learner). و تعريف النموذج كأثر يبقى صالحاً: البنية هي قاعدة التصويت على الـ k جيران، والمحتوى المضبوط هو المجموعة المحفوظة (الفصل 040).

الحدود بين ما يضبطه الإنسان وما يُتعلَّم موضوع الفصل 009؛ والمبدأ هنا أن المعاملات الفائقة تعرّف H وأن المعاملات تشير إلى العنصر المحتفَظ به في H.

2.3 قراءة نموذج في Python

في scikit-learn، السمات التي ينتهي اسمها بشرطة سفلية لا توجد إلا بعد التدريب: حضورها هو المعيار التشغيلي الذي يميّز خوارزمية مُنشأة عن نموذج.

python
from sklearn.linear_model import LinearRegression

def appris(objet):
    return [a for a in dir(objet) if a.endswith("_") and not a.startswith("_")]

estimateur = LinearRegression()
print("Avant fit — hyperparamètres  :", estimateur.get_params())
print("Avant fit — attributs appris :", appris(estimateur))
estimateur.fit(X, y)
print("Après fit — attributs appris :", appris(estimateur))
Avant fit — hyperparamètres  : {'copy_X': True, 'fit_intercept': True,
                                'n_jobs': None, 'positive': False, 'tol': 1e-06}
Avant fit — attributs appris : []
Après fit — attributs appris : ['coef_', 'feature_names_in_', 'intercept_',
                                'n_features_in_', 'rank_', 'singular_']

التفسير: قبل الاستدعاء، يجسّد الكائن الخوارزمية وفضاء الفرضيات، معاملاتها الفائقة مرصودة ومعرفتها معدومة. وبعد، يحمل coef_ و intercept_ المعلومة المستقرأة من البيانات، و يسجّل n_features_in_ و feature_names_in_ مخطط المدخل المتوقَّع (الفقرة 5.2). ويلعب الكائن نفسه دورين متتاليين: تسمّي scikit-learn estimator الكائن قبل fit وبعده.


3. التمييز وعواقبه في الإنتاج

3.1 جدول التمييز

المعيارخوارزمية التعلّمالنموذج
الطبيعةإجراءأثر
لحظة الوجودقبل أي بياناتبعد التدريب
الاعتماد على البياناتمعدومكامل
المحتوىتعليماتبنية وقيم معاملات
يحدّدهاختيار تصميم بشريبيانات التدريب
الدعامة الماديةكود، مكتبة مثبَّتةكائن في الذاكرة، ملف مسلسَل
التفرّدخوارزمية واحدة، نماذج كثيرةنموذج لتدريب مؤرَّخ
ما يُصدَّراعتماد برمجي (scikit-learn==1.8.0)مُسلَّم محدَّد (modele_attrition_v3.joblib)
ما يُنشَرلا، إلا لإعادة التدريبنعم
التقادمبتقادم المكتبةبانحراف توزيع البيانات (الفصل 082)

3.2 تشبيه الوصفة والكعكة

تشبيه — الوصفة والكعكة

الوصفة نص: لا تُؤكَل، ولا تتقادم، وتبقى متطابقة أيّاً كان عدد مرات تنفيذها وتُنسَخ بلا فقدان. والكعكة كائن: تنتج عن تنفيذ الوصفة على مكوّنات دقيقة، في فرن مضبوط بطريقة معيّنة، في يوم معيّن. كعكتان صادرتان عن الوصفة نفسها تختلفان إذا اختلفت المكوّنات؛ والكعكة تُنقَل، وتُؤرَّخ، وتتقادم.

العنصر الطهويالمقابل في التعلّم المُوجَّهالتسويغ
الوصفة المكتوبةخوارزمية التعلّمإجراء قابل لإعادة الإنتاج، مستقل عن أي تنفيذ
المكوّناتمجموعة بيانات التدريبمادة أولية يستهلكها الإجراء
ضبط الفرن وزمن الخبزالمعاملات الفائقةتُثبَّت قبل التنفيذ، من إنسان، غير مشتقّة من المادة
فعل الخبزالتدريبتنفيذ الإجراء على المادة الأولية
الكعكة المحصَّلةالنموذجنتيجة فريدة، مؤرَّخة، تعتمد بالكامل على المكوّنات
حصة مقدَّمة لضيفتنبؤاستخدام النتيجة على حالة خاصة
إرسال الوصفة لضيف جائعنشر الخوارزمية بدلاً من النموذجعلى الضيف شراء المكوّنات والخبز بنفسه
الكعكة المغلفة والمسلَّمةالنموذج المسلسَل والمنشورما يُنقَل فعلاً إلى المستهلك
إعادة دفعة بمكوّنات طازجةإعادة التدريبالوصفة نفسها، مادة جديدة، نتيجة جديدة

حدود التشبيه. الكعكة كائن سلبي، بينما النموذج دالة مدخل نحو مخرج (الفقرة 5.2)؛ وحصة مستهلكة لم تعد متاحة، بينما ينتج نموذج عدداً غير محدود من التنبؤات دون استنفاد؛ وأخيراً تتقادم الكعكة بتلف فيزيائي، بينما ملف نموذج لا يتدهور — إن توزيع بيانات الإنتاج هو الذي يبتعد عن توزيع التدريب (الفصل 082).

3.3 خوارزمية واحدة، مجموعتا بيانات، نموذجان

يطبق الكود التالي خوارزمية واحدة على مجموعتي بيانات تصفان الظاهرة نفسها — سعر مسكن حسب مساحته وعدد غرفه و عمره — في سوقين عقاريين متميّزين.

تتضمّن كل مجموعة 800 معاملة موصوفة بثلاثة متغيرات توضيحية.

python
import pandas as pd
from sklearn.linear_model import LinearRegression

VARIABLES = ["surface_m2", "nb_pieces", "age_bien"]
lyon, nantes = pd.read_csv("marche_lyon.csv"), pd.read_csv("marche_nantes.csv")
X_lyon,   y_lyon   = lyon[VARIABLES],   lyon["prix"]
X_nantes, y_nantes = nantes[VARIABLES], nantes["prix"]

modele_lyon   = LinearRegression().fit(X_lyon,   y_lyon)
modele_nantes = LinearRegression().fit(X_nantes, y_nantes)
print("Même classe d'algorithme :", type(modele_lyon) is type(modele_nantes))

for nom, m in [("LYON", modele_lyon), ("NANTES", modele_nantes)]:
    print(f"{nom:7s} constante = {m.intercept_:>10,.1f} | " +
          " | ".join(f"{v} = {c:,.1f}" for v, c in zip(X_lyon.columns, m.coef_)))

bien = pd.DataFrame([{"surface_m2": 85, "nb_pieces": 4, "age_bien": 12}])
print("Prédiction Lyon   :", round(float(modele_lyon.predict(bien)[0]), 1))
print("Prédiction Nantes :", round(float(modele_nantes.predict(bien)[0]), 1))
Même classe d'algorithme : True
LYON    constante =   43,617.1 | surface_m2 = 3,201.6 | nb_pieces = 8,090.7 | age_bien = -878.3
NANTES  constante =   30,521.4 | surface_m2 = 1,904.5 | nb_pieces = 4,658.9 | age_bien = -1,473.9
Prédiction Lyon   : 337575.3
Prédiction Nantes : 193349.8

التفسير. أُنشئت صنف خوارزمية واحد، دون تعديل أي معامل فائق. يتشارك الكائنان النوع نفسه والبنية نفسها — معادلة تآلفية بثلاثة متغيرات — ويختلفان فقط بقيم معاملاتهما الأربعة، الصادرة بالكامل عن البيانات. والفجوة ذات طبيعة مهنية: يثمّن نموذج ليون المتر المربّع بنحو 3 200 وحدة نقدية، والنانتياسي بنحو 1 900، والخصم المرتبط بالعمر أقوى بنحو 1,7 مرة في السوق الثاني. مستجوَبين عن العقار نفسه، يجيبان 337 575 و 193 350: لا يخطئ أي منهما، بل يرمّزان سوقين مختلفين.

النتيجة المباشرة: «نستخدم انحداراً خطياً» لا يحدّد نظام تنبؤ، بل يسمّي الانحياز الاستقرائي المحتفَظ به. والنظام محدَّد بالزوج (نموذج، مجموعة تدريب)، مؤرَّخ.

3.4 ما يُنشَر فعلاً

النموذج بالمعنى الدقيق — بنية ومعاملات المقدِّر النهائي — لا يكفي لإنتاج تنبؤ في الإنتاج. يجب أن تخضع ملاحظة خام للتحويلات نفسها تماماً التي خضعت لها بيانات التدريب: إسناد بقيم الاستبدال نفسها، ترميز بأنماط المرجع نفسها، تحجيم بالمتوسطات والانحرافات المعيارية نفسها. وهذه التحويلات تتضمّن هي نفسها معاملات مضبوطة على التدريب: تشكّل جزءاً مما يُتعلَّم ويجب تسلسلها مع المقدِّر.

تعريف — تسلسل نموذج

التعريف الدقيق. تحويل الحالة الكاملة لكائن في الذاكرة — بنية وقيم معاملات — إلى تتابع بايتات دائم، يتيح إعادة بنائه لاحقاً في عملية متميّزة بسلوك متطابق وظيفياً.

ترجمة إلى اللغة اليومية. حفظ النموذج في ملف بحيث يمكن إعادة تحميله لاحقاً، في موضع آخر، دون إعادة تدريبه. والصيغ المعتادة هي joblib و pickle (نظام Python البيئي، تعتمد على النسخ)، و ONNX (قابلة للتشغيل البيني بين اللغات ومحرّكات التنفيذ)، و PMML (معيار XML، عائلات نماذج محدودة) والصيغ الأصلية للمكتبات، مثل Booster.save_model لـ XGBoost و LightGBM.

نقطة انتباه. ملف joblib أو pickle يعيد بناء كائنات Python اعتباطية عند القراءة: تحميله دون إتقان مصدره يعادل تنفيذ كود غير متحقَّق منه. علاوة على ذلك، إعادة التسلسل تحت نسخة مكتبة مختلفة غير مضمونة: يجب تسجيل النسخة في البيانات الوصفية والتحقق منها عند التحميل.

python
import os, joblib, sklearn, numpy as np
from sklearn.compose import ColumnTransformer
from sklearn.ensemble import RandomForestClassifier
from sklearn.impute import SimpleImputer
from sklearn.pipeline import Pipeline
from sklearn.preprocessing import OneHotEncoder, StandardScaler

num = ["anciennete_mois", "facture_mensuelle", "nb_appels_support"]
cat = ["type_forfait"]

pipeline = Pipeline([
    ("preparation", ColumnTransformer([
        ("num", Pipeline([("imputation", SimpleImputer(strategy="median")),
                          ("mise_a_echelle", StandardScaler())]), num),
        ("cat", OneHotEncoder(handle_unknown="ignore"), cat)])),
    ("modele", RandomForestClassifier(n_estimators=200, max_depth=8,
                                      random_state=42))]).fit(df, y)

artefact = {"pipeline": pipeline, "version_sklearn": sklearn.__version__,
            "colonnes_attendues": num + cat, "seuil_decision": 0.42,
            "date_entrainement": "2026-08-22"}
joblib.dump(artefact, "modele_attrition_v3.joblib", compress=3)
print("Taille :", round(os.path.getsize("modele_attrition_v3.joblib")/1024, 1), "Ko")

recharge   = joblib.load("modele_attrition_v3.joblib")
p_memoire  = pipeline.predict_proba(df.head(5))[:, 1]
p_recharge = recharge["pipeline"].predict_proba(df.head(5))[:, 1]
print("Probabilités rechargées :", np.round(p_recharge, 4))
print("Identité stricte :", np.array_equal(p_memoire, p_recharge))
print("Version et seuil :", recharge["version_sklearn"], recharge["seuil_decision"])
Taille : 1242.5 Ko
Probabilités rechargées : [0.0678 0.0711 0.0735 0.2408 0.0108]
Identité stricte : True
Version et seuil : 1.8.0 0.42

التفسير. يزن الملف 1,2 ميغابايت بينما لا تتضمّن مجموعة التدريب إلا بضعة آلاف صفوف: هذا الحجم هو حجم الأشجار الـ 200، أي المعاملات المتعلَّمة، ويعتمد على البنية المحتفَظ بها، لا على حجم البيانات. وتعيد إعادة التحميل احتمالات متطابقة بصرامة: النموذج حتمي، وأي تغيّر ملاحَظ في الإنتاج بلا إعادة تدريب يشير إلى فرق في المدخلات أو بيئة التنفيذ، لا في النموذج أبداً. وأخيراً لا ينحصر الأثر في خط الأنابيب: عتبة القرار (الفصل 062) قرار مهني خارج المعاملات، ونسخة المكتبة والقائمة المرتَّبة للأعمدة تشترطان صلاحية التحميل.


4. التدريب بوصفه إجراء اختيار

4.1 التعريف

تعريف — التدريب (training، تعلّم، ضبط، fit)

التعريف الدقيق. تنفيذ الخوارزمية A على مجموعة بيانات D مع معاملات فائقة λ، يتمثّل في اختيار الفرضية ĥ في H التي تحسّن معياراً صريحاً مقيَّماً على D، مصحوباً أحياناً بحد تنظيم:

ĥ = argmin sur h ∈ H de [ (1/n) · Σᵢ L(h(xᵢ), yᵢ) + Ω(h) ]

حيث L تشير إلى دالة التكلفة و Ω حد يعاقب تعقيد الفرضية. وهذا الإطار هو إطار تصغير المخاطر التجريبية (Vapnik). والكمية المصغَّرة مقيسة على عيّنة التدريب، لا على المجتمع: هذه الفجوة أصل فرط التخصيص (الفصل 031).

ترجمة إلى اللغة اليومية. طور الدراسة: تمسح الخوارزمية الأمثلة المصحَّحة، وتضبط معاملاتها لتخطئ أقل ما يمكن على هذه الأمثلة، وتتوقف عندما لا يتحسّن المعيار بشكل ملحوظ.

ما لا يفعله التدريب. لا يعدّل المعاملات الفائقة، التي تبقى كما قُدِّمت؛ ولا يراكم الاستدعاءات المتتالية، فـ fit ثانٍ يمحو الحالة السابقة بالكامل إلا باللجوء إلى partial_fit أو warm_start؛ ولا يقيّم النموذج المنتَج، فالتقييم يتطلّب بيانات غير مرئية.

نقطة انتباه. المعيار المحسَّن أثناء التدريب (دالة التكلفة) ومعيار التقييم المهني (المقياس) متميّزان ويتطابقان نادراً (الفصل 030).

4.2 المكوّنات الثلاثة لإجراء تدريب

تعديل أحد هذه المكوّنات الثلاثة ينتج نموذجاً مختلفاً، بمجموعة بيانات ثابتة.

4.3 أشكال البحث وقابلية إعادة الإنتاج

الخوارزميةاستراتيجية البحث في Hالحتمية ببيانات ثابتة
انحدار خطي (مربعات صغرى)حل تحليلي أو تحليل مصفوفينعم
انحدار لوجستيتحسين عددي محدّب تكرارينعم، بمحلّل وتسامح ثابتين
شجرة قراربحث جشع، قطع أمثل محلي لكل عقدةنعم إذا لم يكن هناك سحب عشوائي لمتغيرات
غابة عشوائيةأشجار مبنية على عيّنات وفضاءات جزئية مسحوبة عشوائياًلا، إلا ببذرة ثابتة
تعزيز تدرّجيإضافة تتابعية لمتعلّمين يصحّحون البقايالا، إلا ببذرة ثابتة
أقرب k جيرانلا بحث: حفظ مجموعة التدريبنعم
مدرك متعدّد الطبقاتانحدار تدرّجي عشوائي بانتشار عكسيلا، إلا ببذرة ثابتة وتنفيذ حتمي مفروض

نقطة انتباه: للخوارزميات المعلَّمة «لا»، تدريبان متتاليان على المجموعة نفسها بالمعاملات الفائقة نفسها ينتجان نموذجين مختلفين. وتثبيت بذرة (random_state) يشترط قابلية إعادة إنتاج المُسلَّم ويجب أن يظهر في البيانات الوصفية.


5. التنبؤ والاستدلال

5.1 التعريف

تعريف — التنبؤ (prediction، scoring)

التعريف الدقيق. تقييم الدالة ĥ عند نقطة x من فضاء المتغيرات التوضيحية، منتجاً قيمة ŷ = ĥ(x) من فضاء المخرج. والملاحظة x لا تنتمي بالضرورة إلى مجموعة التدريب؛ والمنفعة التشغيلية تكمن تحديداً في الحالة التي لا تنتمي إليها.

ترجمة إلى اللغة اليومية. إعطاء جواب لحالة جديدة، بـ تطبيق القاعدة المتعلَّمة. يميّز الاصطلاح y، القيمة الحقيقية الملاحَظة، و ŷ، القيمة التي ينتجها النموذج؛ وفرقهما هو الباقي (الفصل 066).

نقطة انتباه. لا يحمل المصطلح أي دلالة زمنية. نموذج يشخّص مرضاً على بيانات حاضرة ينتج تنبؤاً بالمعنى التقني، وإن لم يكن أي مستقبل معنياً.

5.2 النموذج بوصفه دالة مدخل نحو مخرج

ثلاث خصائص تميّز هذه الدالة. الحتمية: استدعاءان بالمدخل نفسه ينتجان المخرج نفسه، فالنموذج لا يتضمّن أي عنصر عشوائي عند التنبؤ حتى عندما تضمّن تدريبه ذلك. غياب الحالة: تنبؤ لا يعدّل النموذج، والتكيّف مع بيانات جديدة يتطلّب إعادة تدريب، عملية متميّزة. الانغلاق على مخطط مدخله: لا يقبل النموذج إلا مدخلات مطابقة للمخطط المسجَّل عند التدريب — المتغيرات نفسها، والترتيب نفسه، والأنواع نفسها، والأنماط الفئوية المعروفة نفسها، و تحويلات مطبَّقة بالمعاملات المتعلَّمة على التدريب، غير معاد حسابها (الفصل 028).

نقطة انتباه: نمط الفشل الأكثر تكلفة ليس خطأ التنفيذ، المرئي، بل التنبؤ المنتَج بلا خطأ انطلاقاً من مدخل سيئ التحويل. خط أنابيب واحد مسلسَل، بدلاً من تتابع خطوات معاد تنفيذها يدوياً في الإنتاج، يلغي صنف الفشل هذا بالبناء (الفصول 076 إلى 079).

5.3 أشكال المخرج

الاستدعاءالمخرج المنتَجالشكلالتوفّر
predict(X)فئة متنبَّأ بها أو قيمة عدديةمتجه بطول nكل المقدِّرات المُوجَّهة
predict_proba(X)احتمالات مقدَّرة حسب الفئةمصفوفة n × K، صفوف مجموعها 1مصنِّفات بمخرج احتمالي
decision_function(X)درجة غير محدودة، غير معايرةمتجه بطول nنماذج بهامش، SVM ونماذج خطية
transform(X)تمثيل محوَّل للمدخلاتمصفوفة n × p′محوِّلات، لا مقدِّرات نهائية

نقطة انتباه: يطبّق predict افتراضياً عتبة 0,5 على الاحتمال المقدَّر. هذه العتبة اصطلاح تنفيذ، لا أمثل؛ ومراجعتها رافعة كبرى (الفصلان 062 و 029).

5.4 الاستدلال بمعنى التعلّم الآلي وبالمعنى الإحصائي

تعريف — الاستدلال: معنيان متميّزان

المعنى 1 — استدلال بمعنى التعلّم الآلي (inference، serving). عملية تتمثّل في تقييم نموذج مدرَّب على بيانات جديدة لـ إنتاج تنبؤات. مرادف للتنبؤ، يعارض المصطلح التدريب ويهيمن على مفردات هندسة الإنتاج: inference server، inference latency، batch inference.

المعنى 2 — استدلال بمعنى إحصائي (statistical inference). مقاربة تتمثّل في تقدير خصائص مجتمع انطلاقاً من عيّنة وكمّ عدم اليقين المرتبط: تقدير نقطي، فترة ثقة، اختبار فرضية، دلالة. تقليد Fisher و Neyman و Pearson.

أصل الغموض. يستخدم المجتمعان الكلمة نفسها لعمليات تتعارض كائناتها: ملاحظة فردية من جهة، و معامل مجتمع من جهة أخرى. ويطوّر التمييز Breiman (2001، Statistical Modeling: The Two Cultures) و Shmueli (2010، To Explain or to Predict?).

نقطة انتباه. نموذج عالي الأداء في التنبؤ لا يوفّر أي ضمان استدلالي: معامل مرتفع لا يثبت لا دلالة الأثر، ولا اتجاهه السببي (الفصل 016).

المعياراستدلال بمعنى MLاستدلال بمعنى إحصائي
الكائن المستهدَفملاحظة فرديةمعامل مجتمع
السؤال المطروحأي قيمة لهذه الحالة الدقيقة؟ما قيمة θ في المجتمع، وبأي عدم يقين؟
المخرج المنتَجتنبؤ ŷتقدير، فترة ثقة، قرار اختبار
معيار الجودةخطأ تعميم على بيانات غير مرئيةخصائص المقدِّر: انحياز، تقارب، تغطية
الفرضيات المحشودةملاحظات i.i.d.، استقرار التوزيعنموذج مولِّد محدَّد، شروط انتظام
سياق الاستخدامهندسة، إنتاج، MLOpsإحصاء، وبائيات، اقتصاد قياسي

توصية صياغة: استخدام «إنتاج تنبؤ» أو «خدمة النموذج» للمعنى الأول، وتسمية «الاستدلال الإحصائي» صراحة للثاني.

6. الدورة الكاملة، من مجموعة البيانات إلى النموذج المسلسَل

الخطوةالمدخل المستهلكالأثر المنتَجالفصل
التأطيرسؤال تجاريمهمة T ومقياس P مصرَّح بهما012
تكوين مجموعة البياناتمصادر تشغيليةمجموعة بيانات موسومة X، y005 إلى 007
الفصلالمجموعة الكاملةمجموعات فرعية تدريب، تحقّق، اختبار026، 027
تحضير مضبوطXtrainX_{\mathrm{train}}محوِّلات مضبوطة022، 023
اختيار الخوارزميةطبيعة المشكلة والقيودفضاء H وانحياز استقرائي محتفَظ بهما049
اختيار المعاملات الفائقةتدريب وتحقّقتكوين λ محتفَظ به034، 035
التدريب النهائيXtrainX_{\mathrm{train}}، ytrainy_{\mathrm{train}}النموذج ĥ029
التقييمXtestX_{\mathrm{test}}، ytesty_{\mathrm{test}}مقاييس أداء في التعميم052 إلى 075
التسلسلخط أنابيب كامل وبيانات وصفيةملف أثر مصدَّر081
الخدمةملاحظات إنتاجتنبؤات081
المراقبةتدفق إنتاجتنبيهات انحراف، قرار إعادة تدريب082

قراءة الدورة. تظهر حلقتان ذواتا طبيعة مختلفة. الحلقة القصيرة، بين اختيار المعاملات الفائقة والتدريب، تستكشف عدة فضاءات فرضيات أثناء التطوير. والحلقة الطويلة، من المراقبة نحو مجموعة البيانات، يطلقها تدهور الأداء في الإنتاج: تعيد تنفيذ الخوارزمية نفسها على بيانات محدَّثة لإنتاج نموذج جديد، مصدَّر بشكل متميّز. فإعادة التدريب لا تتمثّل إذن أبداً في تعديل الخوارزمية، بل في إنتاج أثر جديد.


7. أخطاء الاستدلال الشائعة

خطأ — قول «نشرنا Random Forest»

ما يُنشَر أثر — بنية وقيم معاملات — صادر عن تنفيذ خوارزمية Random Forest على مجموعة بيانات محدَّدة، في تاريخ محدَّد. والخوارزمية تقيم في المكتبة المثبَّتة.

الصياغة الصحيحة: «نشرنا النموذج attrition_v3، المحصَّل بتدريب غابة عشوائية على بيانات يناير إلى يونيو.»

خطأ — إسناد التعلّم إلى الخوارزمية

تنفّذ الخوارزمية إجراء بحث ولا تحتفظ بشيء في نهاية تنفيذها؛ والمعرفة المستقرأة تقيم في معاملات النموذج المنتَج.

الصياغة الصحيحة: «اختارت الخوارزمية، في فضاء الفرضيات، نموذجاً تشير معاملاته إلى ارتباط سالب بين الأقدمية والإلغاء.»

خطأ — الخلط بين إعادة التدريب وإعادة البرمجة

إعادة التدريب تتمثّل في إعادة تنفيذ الخوارزمية نفسها، بالمعاملات الفائقة نفسها، على بيانات محدَّثة: لا يُعدَّل أي سطر كود. ويقود الالتباس إلى الاستخفاف بالتكلفة الحقيقية لدورة الصيانة.

الصياغة الصحيحة: «تنتج إعادة التدريب الشهرية نسخة جديدة من النموذج بلا تعديل لكود التدريب.»

خطأ — تسلسل المقدِّر بلا خط أنابيب تحضيره

تتضمّن تحويلات التحضير معاملات متعلَّمة على بيانات التدريب: وسيطات إسناد، أنماط ترميز، متوسطات و انحرافات معيارية. مقدِّر مسلسَل وحده، يُغذَّى بتحويلات معاد تنفيذها يدوياً، ينتج تنبؤات خاطئة بلا خطأ مرئي.

الصياغة الصحيحة: «الأثر المسلسَل هو خط الأنابيب الكامل، من البيانات الخام إلى التنبؤ، مصحوباً ببياناته الوصفية.»

خطأ — استخدام «استدلال» دون تحديد المعنى

يشير المصطلح، حسب المجتمع، إلى إنتاج تنبؤ على ملاحظة أو تقدير معامل مجتمع مصحوب بمقياس عدم يقين: لا الكائن نفسه، ولا معايير الصلاحية نفسها.

الصياغة الصحيحة: «ينتج خادم الاستدلال تنبؤات. أما الاستنتاجات المتعلقة بالمجتمع فتندرج تحت استدلال إحصائي، لا يوفّره هذا الجهاز.»


8. الخلاصة

الكائنان
    خوارزمية التعلّم — إجراء.  A : (D, λ) → ĥ ∈ H
        توجد قبل البيانات، لا تحتوي أي معرفة،
        تُصدَّر كاعتماد برمجي.
    النموذج — أثر.  بنية تثبّتها A و λ،
        معاملات مضبوطة على D. لا يوجد إلا بعد التدريب،
        يعتمد بالكامل على D، يُصدَّر كمُسلَّم مؤرَّخ.

المكوّنات الثلاثة لخوارزمية تعلّم
    1. فضاء فرضيات H    أي قواعد مرشَّحة
    2. معيار تحسين   كيف نقيس جودتها على D
    3. استراتيجية بحث  كيف نمسح H

الانحياز الاستقرائي (Mitchell، 1980)
    التفضيلات غير المشتقّة من البيانات التي تتيح اختيار
    تعميم من بين تلك المتوافقة مع D. بلا انحياز،
    لا تعميم ممكن. No Free Lunch (Wolpert، 1996) :
    لا انحياز متفوّق عالمياً ؛ اختيار خوارزمية،
    رهان على شكل الظاهرة.

العمليتان
    التدريب   D, λ → ĥ         اختيار في H
    التنبؤ     x    → ŷ = ĥ(x)  تقييم دالة

النموذج بوصفه دالة
    مدخل (متغيرات) → [ نموذج ] → مخرج (تنبؤ)
    حتمي · بلا حالة · مغلق على مخطط مدخله

التشبيه الطهوي
    وصفة → خوارزمية          مكوّنات → مجموعة تدريب
    فرن    → معاملات فائقة     خبز     → تدريب
    كعكة  → نموذج              حصة مقدَّمة → تنبؤ
    كعكة مغلفة ومسلَّمة       → أثر مسلسَل منشور

معنيان لكلمة استدلال
    معنى ML          إنتاج تنبؤ لملاحظة
    معنى إحصائي تقدير معامل مجتمع مع
                     كمّ عدم اليقين

ما يُنشَر فعلاً
    ليس المقدِّر وحده، بل خط الأنابيب الكامل (إسناد،
    ترميز، تحجيم، مقدِّر) وبياناته الوصفية :
    نسخة مكتبة، مخطط مدخل، عتبة قرار،
    بذرة عشوائية، تاريخ، نطاق صلاحية.

اختبار المفردات
    «الإجراء» يحل محل المصطلح → الخوارزمية.
    «الملف المدرَّب» يحل محل    → النموذج.

عبارة تلخيصية

خوارزمية التعلّم إجراء يختار، انطلاقاً من مجموعة بيانات ومعاملات فائقة، في فضاء فرضيات القاعدة التي تحسّن معياراً؛ والنموذج هذه القاعدة بعد اختيارها، أثر مكوَّن من بنية ومعاملات مضبوطة، يعتمد بالكامل على البيانات التي أنتجته؛ والتدريب عملية الاختيار، والتنبؤ تقييم الدالة المحصَّلة على ملاحظة جديدة، وما يُصدَّر ويُسلسَل ويُنشَر في الإنتاج ليس أبداً الخوارزمية بل النموذج مصحوباً بخط أنابيب تحضيره وبياناته الوصفية.


الاختبارات المرتبطة

  • 008.1-quiz-algorithme-apprentissage.md
  • 008.2-quiz-modele-artefact.md
  • 008.3-quiz-distinction-production.md
  • 008.4-quiz-entrainement.md
  • 008.5-quiz-prediction-inference.md
  • 008.6-quiz-cycle-complet.md

الفصل التالي: 009-parametres-hyperparametres.md