ML 101
M09 · L02
الوحدة 9

بنية المحوّل

كيف أنتج تكديس الانتباه وطبقات التغذية الأمامية مع الوصلات المتبقية وتطبيع الطبقة والترميز الموضعي البنية التي تهيمن الآن على كل التعلم العميق.

01 / 11
ML 101
M09 · L02
فاسواني وآخرون، 2017

الانتباه هو كل ما تحتاجه

الورقة أزالت التكرار بالكامل. لا حالات مخفية، لا تبعيات تسلسلية — فقط طبقات انتباه وشبكات تغذية أمامية. في غضون عام تجاوزت كل معايير الشبكات التكرارية. في غضون عامين أعادت تشكيل المجال كله.

طبقات الترميز
N = 6
بُعد النموذج
d = 512
02 / 11
ML 101
M09 · L02
نظرة عامة على البنية

مكدسا الترميز وفاك الترميز

  • الترميز: N طبقة من الانتباه الذاتي + التغذية الأمامية، يعالج المدخل الكامل بالتوازي
  • فاك الترميز: N طبقة من الانتباه الذاتي المُقنَّع + الانتباه المتقاطع + التغذية الأمامية
  • الانتباه الذاتي المُقنَّع يمنع الانتباه للرموز المستقبلية (ذاتي تراجعي)
  • الانتباه المتقاطع يُتيح لفاك الترميز استعلام تمثيلات الترميز في كل خطوة
03 / 11
ML 101
M09 · L02
الترميز الموضعي

حقن الترتيب

الترميز الموضعي الجيبي
PE_{(pos,2i)}=\sin\!\left(\frac{pos}{10000^{2i/d}}\right)

يُضاف لتضمينات الرمز قبل الطبقة الأولى. الشكل الجيبي يُعمّم على أطوال لم تُشاهَد في التدريب. النماذج الحديثة غالبًا ما تستخدم ترميزات مُتعلمة أو نسبية (RoPE وALiBi).

04 / 11
ML 101
M09 · L02
الوصلة المتبقية + تطبيع الطبقة

تدريب المكدسات العميقة

مُغلِّف الطبقة الفرعية
\text{LayerNorm}(x+\text{Sublayer}(x))

الوصلات المتبقية تُعطي التدرجات ممرًا مباشرًا عبر الشبكات العميقة. تطبيع الطبقة يُثبِّت مقاييس التنشيط بشكل مستقل عن حجم الدُّفعة.

05 / 11
ML 101
M09 · L02
الطبقة الفرعية ذات التغذية الأمامية

حوسبة لكل موضع

التغذية الأمامية
\max(0,xW_1+b_1)\,W_2+b_2

الانتباه يخلط عبر المواضع. التغذية الأمامية تُحوّل كل موضع بشكل مستقل. تتوسع إلى 4×dmodel ثم تنكمش. تُشير الأبحاث إلى أنها تخزّن المعرفة الواقعية.

06 / 11
ML 101
M09 · L02
لماذا تتطور المحوّلات

توازٍ كامل

  • الشبكات التكرارية: التبعية التسلسلية تُجبر ht على انتظار ht-1
  • المحوّلات: جميع المواضع تُحسب في وقت واحد كضرب مصفوفي
  • قدرة إنتاج التدريب تتناسب مع توازي GPU وليس طول التسلسل
  • مزيد من الأجهزة = مزيد من الإنتاج بشكل متناسب
07 / 11
ML 101
M09 · L02
طول مسار ثابت

التبعيات بعيدة المدى

  • الشبكة التكرارية: التدرج يسافر عبر k خطوة للربط بين الموضع t وt−k
  • المحوّل: كل موضع ينتبه مباشرة لكل موضع آخر في طبقة واحدة (طول المسار = 1)
  • التبعيات بعيدة المدى ليست أصعب في التعلم من تلك قريبة المدى
  • حتى LSTM تتدهور في التسلسلات الطويلة جدًا؛ المحوّل لا يتدهور
08 / 11
ML 101
M09 · L02
قوانين التطوير

تحسّن قابل للتنبؤ

  • الأداء يتبع قانون قوة في الحوسبة والبيانات والمعاملات
  • مضاعفة أي مورد تُعطي مكسبًا متسقًا ومتوقعًا
  • هذا الانتظام أتاح GPT-3 وGPT-4 والنماذج التأسيسية الحديثة
  • عنق الزجاجة الرئيسي: انتباه O(n²) — FlashAttention والأساليب المتفرقة تعالج هذا
09 / 11
ML 101
اختبار سريع

تحقّق ممّا ترسّخ

أربعة أسئلة من هذا الدرس. أجب لترى السبب — يظهر الشرح سواء أصبت أم أخطأت. لا شيء يُحتسب أو يُحفظ.

السؤال 1 من 0
النتيجة 0/0

10 / 11
ML 101
ملخص
مراجعة

ما الذي تعلّمته

يُكدِّس المحوّل الانتباه + التغذية الأمامية + الوصلات المتبقية + تطبيع الطبقة في بنية موازية بالكامل. الترميز الموضعي يحقن الترتيب. ثلاث خصائص — التوازي وطول المسار الثابت وقوانين التطوير — تفسّر هيمنته. الدرس 9.3 يستعرض عائلة المحوّلات الحديثة: BERT وGPT وT5 وViT.

11 / 11