الانتباه والمحوّلات

2 دقيقة

الهدف: فهم Query وKey وValue والانتباه متعدّد الرؤوس (Multi-head attention) وكتل Transformer.

يُتيح الانتباه لكل موقع أن يُوازن المعلومات القادمة من مواقع أخرى. انطلاقاً من تمثيل X، نحسب:

text
Q = XW_Q,  K = XW_K,  V = XW_V
Attention(Q,K,V) = softmax(QKᵀ / √d_k) V

يصف الاستعلام Q ما يبحث عنه الموقع، وتصف المفاتيح K ما تعرضه كل موقع، أما القيم V فهي المعلومة الواجب تجميعها. تجنّب القسمة على √d_k نقاطاً كبيرة تُشبِع softmax.

الانتباه متعدّد الرؤوس

تُسقِط عدة رؤوس البيانات في فضاءات جزئية مختلفة، وتُطبّق الانتباه بالتوازي، ثم تدمج مخارجها وتُعيد إسقاطها. ليس مضموناً أن يُطابق رأس واحد مفهوماً بشرياً ثابتاً.

كتلة Transformer

تحتوي الكتلة عادةً على: انتباه، ثم وصلة متبقية، ثم تطبيع، ثم شبكة feed-forward مُطبَّقة موقعاً بموقع، ثم وصلة متبقية أخرى، ثم تطبيع. بدون معلومة موقعية، فإن self-attention غير حساسة للترتيب؛ لذا نُضيف ترميزات موقعية مُتعلَّمة أو محسوبة.

معاينة — بقية الدرس متاحة للمسجّلين فقط.

هل سجّلت من قبل برمز؟

وصولك مرتبط بحسابك وليس بهذا الرابط. سجّل الدخول بنفس البريد الذي استخدمته في الصف: دورتك بانتظارك، ولا حاجة لإدخال الرمز مجددًا.

تسجيل الدخولليس لديك حساب بعد؟ أنشئ حسابًا
هذا الدرس جزء من وحدة «المعماريات المتخصصة»

الوحدات الأولى من الدورة مفتوحة للجميع. أما البقية فأمامك ثلاثة خيارات: شراء هذه الدورة مرة واحدة، أو الاشتراك، أو إدخال الرمز الموزّع في القاعة.

هل أنت طالب في هذه الدورة؟

يرتبط الرمز بحسابك: سجّل الدخول أو أنشئ حسابًا وسيُطبَّق تلقائيًا عند عودتك.

ليس لديك حساب بعد؟ أنشئ حسابًا