الهدف: فهم Query وKey وValue والانتباه متعدّد الرؤوس (Multi-head attention) وكتل Transformer.
يُتيح الانتباه لكل موقع أن يُوازن المعلومات القادمة من مواقع أخرى. انطلاقاً من تمثيل X،
نحسب:
Q = XW_Q, K = XW_K, V = XW_V
Attention(Q,K,V) = softmax(QKᵀ / √d_k) Vيصف الاستعلام Q ما يبحث عنه الموقع، وتصف المفاتيح K ما تعرضه كل موقع، أما القيم V
فهي المعلومة الواجب تجميعها. تجنّب القسمة على √d_k نقاطاً كبيرة تُشبِع softmax.
تُسقِط عدة رؤوس البيانات في فضاءات جزئية مختلفة، وتُطبّق الانتباه بالتوازي، ثم تدمج مخارجها وتُعيد إسقاطها. ليس مضموناً أن يُطابق رأس واحد مفهوماً بشرياً ثابتاً.
تحتوي الكتلة عادةً على: انتباه، ثم وصلة متبقية، ثم تطبيع، ثم شبكة feed-forward مُطبَّقة موقعاً بموقع، ثم وصلة متبقية أخرى، ثم تطبيع. بدون معلومة موقعية، فإن self-attention غير حساسة للترتيب؛ لذا نُضيف ترميزات موقعية مُتعلَّمة أو محسوبة.
معاينة — بقية الدرس متاحة للمسجّلين فقط.
وصولك مرتبط بحسابك وليس بهذا الرابط. سجّل الدخول بنفس البريد الذي استخدمته في الصف: دورتك بانتظارك، ولا حاجة لإدخال الرمز مجددًا.
تسجيل الدخولليس لديك حساب بعد؟ أنشئ حسابًاالوحدات الأولى من الدورة مفتوحة للجميع. أما البقية فأمامك ثلاثة خيارات: شراء هذه الدورة مرة واحدة، أو الاشتراك، أو إدخال الرمز الموزّع في القاعة.