بنية المحوّل
كيف أنتج تكديس الانتباه وطبقات التغذية الأمامية مع الوصلات المتبقية وتطبيع الطبقة والترميز الموضعي البنية التي تهيمن الآن على كل التعلم العميق.
الانتباه هو كل ما تحتاجه
الورقة أزالت التكرار بالكامل. لا حالات مخفية، لا تبعيات تسلسلية — فقط طبقات انتباه وشبكات تغذية أمامية. في غضون عام تجاوزت كل معايير الشبكات التكرارية. في غضون عامين أعادت تشكيل المجال كله.
مكدسا الترميز وفاك الترميز
- الترميز: N طبقة من الانتباه الذاتي + التغذية الأمامية، يعالج المدخل الكامل بالتوازي
- فاك الترميز: N طبقة من الانتباه الذاتي المُقنَّع + الانتباه المتقاطع + التغذية الأمامية
- الانتباه الذاتي المُقنَّع يمنع الانتباه للرموز المستقبلية (ذاتي تراجعي)
- الانتباه المتقاطع يُتيح لفاك الترميز استعلام تمثيلات الترميز في كل خطوة
حقن الترتيب
يُضاف لتضمينات الرمز قبل الطبقة الأولى. الشكل الجيبي يُعمّم على أطوال لم تُشاهَد في التدريب. النماذج الحديثة غالبًا ما تستخدم ترميزات مُتعلمة أو نسبية (RoPE وALiBi).
تدريب المكدسات العميقة
الوصلات المتبقية تُعطي التدرجات ممرًا مباشرًا عبر الشبكات العميقة. تطبيع الطبقة يُثبِّت مقاييس التنشيط بشكل مستقل عن حجم الدُّفعة.
حوسبة لكل موضع
الانتباه يخلط عبر المواضع. التغذية الأمامية تُحوّل كل موضع بشكل مستقل. تتوسع إلى 4×dmodel ثم تنكمش. تُشير الأبحاث إلى أنها تخزّن المعرفة الواقعية.
توازٍ كامل
- الشبكات التكرارية: التبعية التسلسلية تُجبر ht على انتظار ht-1
- المحوّلات: جميع المواضع تُحسب في وقت واحد كضرب مصفوفي
- قدرة إنتاج التدريب تتناسب مع توازي GPU وليس طول التسلسل
- مزيد من الأجهزة = مزيد من الإنتاج بشكل متناسب
التبعيات بعيدة المدى
- الشبكة التكرارية: التدرج يسافر عبر k خطوة للربط بين الموضع t وt−k
- المحوّل: كل موضع ينتبه مباشرة لكل موضع آخر في طبقة واحدة (طول المسار = 1)
- التبعيات بعيدة المدى ليست أصعب في التعلم من تلك قريبة المدى
- حتى LSTM تتدهور في التسلسلات الطويلة جدًا؛ المحوّل لا يتدهور
تحسّن قابل للتنبؤ
- الأداء يتبع قانون قوة في الحوسبة والبيانات والمعاملات
- مضاعفة أي مورد تُعطي مكسبًا متسقًا ومتوقعًا
- هذا الانتظام أتاح GPT-3 وGPT-4 والنماذج التأسيسية الحديثة
- عنق الزجاجة الرئيسي: انتباه O(n²) — FlashAttention والأساليب المتفرقة تعالج هذا
ما الذي تعلّمته
يُكدِّس المحوّل الانتباه + التغذية الأمامية + الوصلات المتبقية + تطبيع الطبقة في بنية موازية بالكامل. الترميز الموضعي يحقن الترتيب. ثلاث خصائص — التوازي وطول المسار الثابت وقوانين التطوير — تفسّر هيمنته. الدرس 9.3 يستعرض عائلة المحوّلات الحديثة: BERT وGPT وT5 وViT.