الانتباه هو كل ما تحتاجه
في عام 2017، نشر فاسواني وزملاؤه ورقة “الانتباه هو كل ما تحتاجه”، ورقة كان عنوانها استفزازًا بقدر ما كان وصفًا. جادل المؤلفون بأن الوصلات التكرارية التي ميّزت نمذجة التسلسل لثلاثة عقود — الحالات المخفية التي تنقل المعلومات خطوة بخطوة — لم تكن غير ضرورية فحسب بل كانت ضارة بنشاط. يمكن القيام بكل العمل الذي تؤديه بشكل أفضل وأسرع وأكثر قابلية للتطوير بالانتباه وحده.
كانت النتيجة هي المحوّل: نموذج مبني بالكامل من طبقات الانتباه والشبكات ذات التغذية الأمامية، دون أي تكرار على الإطلاق. في غضون عام، تجاوز أحدث نماذج الشبكات التكرارية والشبكات التلافيفية على كل معيار لغوي رئيسي. في غضون عامين، أعادت المتغيرات المُضخّمة (BERT، GPT-2) تشكيل المجال بأكمله. المحوّل هو البنية المهيمنة الآن ليس فقط للغة بل للرؤية والصوت والتنبؤ ببنية البروتين وكل مجال تقريبًا يتضمن بيانات تسلسلية أو مكانية.
يشرّح هذا الدرس بنية المحوّل من الأساس: بنية الترميز–فك الترميز، والترميز الموضعي، وتطبيع الطبقة مع الوصلات المتبقية، وطبقات التغذية الأمامية، والسؤال المحوري عن سبب تطوير المحوّلات بشكل أفضل من الشبكات التكرارية. وفي نهايته ستفهم لا كيف يعمل المحوّل فحسب، بل لماذا اتُّخذ كل قرار تصميمي فيه.
بنية الترميز–فك الترميز
صُمِّم المحوّل الأصلي لمهام التسلسل إلى التسلسل (تحديدًا الترجمة الآلية)، لذا يستخدم بنية ترميز–فك ترميز. يقرأ الترميز تسلسل المدخل بأكمله وينتج سلسلة من التمثيلات المتصلة. يولّد فاك الترميز تسلسل المخرجات رمزًا واحدًا في كل مرة، منتبهًا لكل من تمثيلات الترميز ورموز المخرجات المولَّدة سابقًا.
يتكون كل ترميز من مكدس من N طبقة متطابقة (N = 6 في الورقة الأصلية). كل طبقة لها طبقتان فرعيتان: طبقة انتباه ذاتي متعدد الرؤوس وطبقة تغذية أمامية حسب الموضع. كل طبقة فرعية مغلّفة في وصلة متبقية يتبعها تطبيع طبقة. الأهم أن كل طبقة في الترميز تعالج التسلسل الكامل في وقت واحد — جميع المواضع بالتوازي دون أي تبعية تسلسلية.
فاك الترميز منظّم بالمثل مع N طبقة متطابقة، لكن كل طبقة في فاك الترميز لها ثلاث طبقات فرعية: طبقة انتباه ذاتي مُقنَّعة متعددة الرؤوس (مُقنَّعة لمنع الانتباه للمواضع المستقبلية)، وطبقة انتباه متقاطع (تنتبه لمخرج الترميز)، وطبقة تغذية أمامية حسب الموضع. يُطبّق القناع في الطبقة الفرعية الأولى لفاك الترميز الخاصية الذاتية التراجعية: خلال التدريب، يمكن لكل موضع في فاك الترميز الانتباه فقط للمواضع الأقدم في تسلسل المخرجات، لأن الرموز المستقبلية غير معروفة بعد.
مع أن المحوّل الأصلي يستخدم بنية ترميز–فك ترميز، تستخدم التطبيقات الحديثة في الغالب نصفًا واحدًا فقط. نماذج الترميز فقط (مثل BERT) تعالج المدخل الكامل ثنائي الاتجاه وتتفوق في مهام الفهم: التصنيف، التعرف على الكيانات، الإجابة على الأسئلة. نماذج فاك الترميز فقط (مثل GPT) تولّد النص تلقائيًا وتتفوق في مهام التوليد. تظل بنية الترميز–فاك الترميز مهيمنة للترجمة والتلخيص وغيرها من المهام التي تُحوّل تسلسلًا إلى آخر.
الترميز الموضعي
الانتباه الذاتي لا يمتلك مفهومًا جوهريًا للترتيب: معادلة الانتباه تعامل جميع المواضع بالتساوي بصرف النظر عن مكان ظهورها في التسلسل. في اللغة، الموضع مهم للغاية — “الكلب عض الرجل” و“الرجل عض الكلب” لهما معانٍ متضادة رغم استخدامهما نفس الكلمات. يحل المحوّل هذا عن طريق حقن معلومات الموضع مباشرة في تضمينات المدخل قبل طبقة الانتباه الأولى.
تستخدم الورقة الأصلية الترميزات الموضعية الجيبية: لكل موضع pos وكل بُعد i في النموذج، الترميز هو جيب أو جيب تمام لتردد يتناقص هندسيًا مع البُعد. تستخدم الأبعاد الزوجية الجيب؛ وتستخدم الأبعاد الفردية جيب التمام:
يُضاف الترميز الموضعي إلى تضمين الرمز (لا يُدمج معه). الناتج يمر إلى طبقة الترميز أو فاك الترميز الأولى. ولأن التضمين والترميز الموضعي لهما البُعد نفسه dmodel، يستطيع النموذج أن يتعلم فصل هوية الرمز عن معلومات الموضع عبر مصفوفات الأوزان المُتعلمة.
النماذج الحديثة غالبًا ما تستخدم تضمينات موضعية مُتعلمة بدلًا من ذلك — جدول بحث يحمل فيه كل موضع متجه تضمين قابلًا للتدريب. التضمينات المُتعلمة تعمل أفضل قليلًا في الممارسة، لكن ثمن ذلك أنها لا تُعمّم على أطوال تتجاوز أقصى طول تسلسل رآه النموذج في التدريب. وتذهب الترميزات الموضعية النسبية (مثل RoPE وALiBi) أبعد من ذلك: تُعدّل درجات الانتباه مباشرة بحسب المسافة بين المواضع بدلًا من إضافة إشارات موضع مطلقة إلى التضمينات. هذه الطرق النسبية أصبحت معيارًا في نماذج اللغة الكبيرة.
الوصلات المتبقية وتطبيع الطبقة
مكونان يظهران باستمرار في المحوّل وهما ضروريان لتدريب الشبكات العميقة: الوصلات المتبقية وتطبيع الطبقة. كل طبقة فرعية (الانتباه أو التغذية الأمامية) مغلّفة بالنمط:
تعالج الوصلات المتبقية مشكلة التدرج المتلاشي في الشبكات العميقة. دون هذه الوصلات، يجب أن تتدفق التدرجات عبر كل طبقة خلال الانتشار العكسي — كل عملية ضربية تُصغّر التدرج نحو الصفر. توفر الوصلة المتبقية مسارًا مباشرًا لتدفق التدرجات من المخرج إلى المدخل دون المرور بحسابات الطبقة الفرعية. ولهذا يمكن تدريب شبكات عميقة جدًا (100 طبقة وأكثر) باستقرار مع الوصلات المتبقية، وليس بدونها.
يُطبِّع تطبيع الطبقة التنشيطات عبر بُعد الميزة (بُعد dmodel) لكل موضع بشكل مستقل. على عكس تطبيع الدُّفعة الذي يُطبِّع عبر بُعد الدُّفعة، يعمل تطبيع الطبقة على مثال واحد في كل مرة وبالتالي لا يتأثر بحجم الدُّفعة. هذا حرج لنماذج التسلسل حيث تكون أحجام الدُّفعات صغيرة والتسلسلات ذات أطوال متغيرة. وتطبيع الطبقة يُثبِّت التدريب أيضًا بإبقاء مقياس التنشيطات متسقًا عبر الطبقات.
الطبقة الفرعية ذات التغذية الأمامية
تتضمن كل طبقة في المحوّل أيضًا شبكة تغذية أمامية حسب الموضع: شبكة MLP من طبقتين تُطبَّق بشكل مستقل على كل موضع. تُوسِّع الشبكة التمثيل إلى بُعد وسيط أكبر dff (عادةً 4×dmodel)، تُطبِّق عدم خطية، ثم تُسقط مجددًا إلى dmodel:
تخدم طبقة التغذية الأمامية الفرعية وظيفة مختلفة عن طبقة الانتباه الفرعية. الانتباه يجمع المعلومات عبر المواضع — فهو أساسًا عملية خلط. التغذية الأمامية تعالج كل موضع بشكل مستقل — فهي تحويل غير خطي لكل موضع على حدة. معًا، يُشكّلان زوجًا تكامليًا: الانتباه للتواصل بين المواضع، والتغذية الأمامية للحساب لكل موضع.
وجدت أبحاث نماذج اللغة الكبيرة أن طبقات التغذية الأمامية تخزّن المعرفة الواقعية وتسترجعها. يمكن تحديد عصبونات فردية في هذه الطبقات تنشط لوقائع معيّنة (مثل “باريس عاصمة فرنسا”)، وتعديل هذه العصبونات يغيّر ما يقوله النموذج عن الواقع. هذا المنظور — منظور “عصبونات المعرفة” — يشير إلى أن التغذية الأمامية تعمل كذاكرة ترابطية مبنية فوق الاستدلال البنيوي الذي تقدمه آلية الانتباه.
لماذا تتطور المحوّلات بشكل أفضل من الشبكات التكرارية
هيمنة المحوّل على الشبكات التكرارية لا تتعلق فقط بالأداء على مجموعة بيانات ثابتة — بل تتعلق بسلوك التطوير. مع زيادة كمية البيانات والحوسبة ومعاملات النموذج، تستمر المحوّلات في التحسن بطرق لا تتمكن الشبكات التكرارية منها. ثلاث خصائص هيكلية تفسر ذلك:
1. التوازي خلال التدريب. الشبكات التكرارية تعالج التسلسلات خطوة بخطوة: حساب ht يتطلب ht−1، الذي يتطلب ht−2، وهكذا. التبعية التسلسلية تعني أنك لا تستطيع الموازاة عبر بُعد الزمن — عليك أن تنتظر انتهاء كل خطوة قبل بدء التالية. مع تسلسل طوله 1000، هذه 1000 عملية تسلسلية بصرف النظر عن عدد أنوية GPU التي تملكها. المحوّلات تحسب جميع المواضع في وقت واحد كضرب مصفوفي. قدرة إنتاج التدريب تتناسب مع توازي الأجهزة وليس بعنق زجاجة طول التسلسل.
2. طول مسار ثابت بين أي موضعين. في الشبكة التكرارية، يجب أن يسافر التدرج عبر كل حالة مخفية وسيطة للربط بين الموضع t والموضع t−k — طول مسار k. للتسلسلات الطويلة، هذا المسار طويل جدًا لدرجة أن التدرجات تتلاشى ويفشل النموذج في تعلم التبعيات بعيدة المدى (وشبكة LSTM تُخفّف هذا لكنها لا تُلغيه). في المحوّل، كل موضع ينتبه مباشرة لكل موضع آخر في طبقة واحدة — طول مسار 1. التبعيات بعيدة المدى ليست أصعب في التعلم من تلك قريبة المدى.
3. قوانين تطوير قابلة للتنبؤ. وجد كابلان وزملاؤه (2020) أن أداء نماذج اللغة المبنية على المحوّل يتبع قانون قوة في الحوسبة وحجم مجموعة البيانات وعدد المعاملات: مضاعفة أي مورد تُعطي تحسينًا متسقًا ومتوقعًا. هذا الانتظام يعني أنك تستطيع أن تُقدّر مسبقًا مقدار الأداء الذي ستكسبه من التوسيع. الشبكات التكرارية لا تُظهر سلوك تطوير بهذا الوضوح، جزئيًا لأن طبيعتها التسلسلية تضع سقفًا لفائدة الحوسبة الإضافية عند طول تسلسل معيّن. بنية المحوّل تتلاءم بشكل فريد مع استراتيجية “تطوير كل شيء” التي أنتجت GPT-3 وGPT-4 والنماذج المماثلة.
القيد الرئيسي للمحوّل هو التكلفة التربيعية للانتباه الكامل — وهي نفس تكلفة O(n²) التي عُرِّفت عند تقديم الانتباه الذاتي في الدرس السابق: يتطلب حساب مصفوفة الانتباه n×n وقتًا O(n²d) وذاكرة O(n²). لأطوال تسلسل متوسطة (512–2048)، هذا مُدار. للوثائق الطويلة أو الصور عالية الدقة أو التسلسلات الجينومية (عشرات الآلاف من الرموز)، تصبح التكلفة باهظة. تتناول أبحاث الانتباه المتفرق (BigBird وLongformer) والانتباه الخطي (Performer وRWKV) وخوارزميات الكفاءة الجهازية (FlashAttention) هذا القيد مع الحفاظ على معظم تعبيرية المحوّل. FlashAttention بالتحديد يُحقق نفس مخرجات الانتباه الكامل بذاكرة O(n) عن طريق دمج حساب الانتباه في نواة واحدة، وقد أصبح معيارًا في تدريب النماذج اللغوية الكبيرة الحديثة.
تمريرة الأمام الكاملة
لنتتبع كيف يتدفق تسلسل عبر الترميز الكامل للمحوّل. تُحوَّل الرموز المدخلة إلى تضمينات من البُعد dmodel. تُضاف الترميزات الموضعية عنصرًا بعنصر. المصفوفة الناتجة (الشكل: طول_التسلسل × dmodel) تمر عبر N طبقات ترميز. كل طبقة تُطبِّق: (1) انتباه ذاتي متعدد الرؤوس مع متبقي وتطبيع طبقة، ثم (2) شبكة تغذية أمامية مع متبقي وتطبيع طبقة. مخرج طبقة الترميز النهائية هو تمثيل غني بالسياق لكل رمز مدخل، إذ يحمل تضمين كل رمز الآن معلومات جُمعت من كل الرموز الأخرى عبر كل رؤوس الانتباه وكل الطبقات.
يتبع فاك الترميز مسارًا مشابهًا مع الطبقة الفرعية الإضافية للانتباه المتقاطع في كل طبقة، وهي التي تستهلك مخرج الترميز. في كل خطوة فك ترميز، يُنتج فاك الترميز توزيعًا احتماليًا على المفردات، ويُختار الرمز التالي بالمعاينة من هذا التوزيع أو بالاختيار الجشع لأعلى احتمال. يُضاف ذلك الرمز لتسلسل المخرجات ويعمل فاك الترميز مجددًا للخطوة التالية، مستمرًا حتى يُولَّد رمز نهاية التسلسل أو يُبلَغ الطول الأقصى.
خلال التدريب نستخدم إجبار المعلّم (teacher forcing): نُغذّي فاك الترميز في كل خطوة برموز المخرجات الصحيحة من التسلسل الهدف المرجعي، لا بتنبؤات النموذج نفسه. والقناع السببي يضمن أن فاك الترميز لا يرى الرموز المستقبلية، وبهذا يبقى التدريب صحيحًا: كل موضع يشترط على رموز ستكون متاحة فعلًا وقت الاستدلال. تمريرة الأمام كلها — الترميز وفك الترميز — تُنفَّذ بالتوازي لجميع المواضع، وهذا ما يجعل التدريب عالي الكفاءة.
- يستبدل المحوّل التكرار بالكامل بطبقات انتباه ذاتي متعدد الرؤوس وتغذية أمامية مُكدَّسة. يعالج الترميز المدخل الكامل بالتوازي؛ يولّد فاك الترميز المخرجات بشكل تلقائي باستخدام الانتباه الذاتي المُقنَّع والانتباه المتقاطع للترميز.
- يحقن الترميز الموضعي معلومات الترتيب في تضمينات الرمز قبل الطبقة الأولى. تُتيح الترميزات الجيبية التعميم على أطوال غير مرئية؛ التضمينات المُتعلمة غالبًا ما تعمل بشكل أفضل عمليًا؛ ترميزات الموضع النسبية (RoPE وALiBi) أصبحت معيارًا في النماذج الكبيرة.
- كل طبقة فرعية مُغلَّفة في وصلة متبقية وتطبيع طبقة. توفر الوصلات المتبقية ممرات للتدرجات عبر المكدسات العميقة؛ تطبيع الطبقة يُثبِّت مقاييس التنشيط بشكل مستقل عن حجم الدُّفعة.
- الطبقة الفرعية ذات التغذية الأمامية هي شبكة MLP من طبقتين تُطبَّق بشكل مستقل على كل موضع، تتوسع إلى 4×dmodel ثم تنكمش. توفر حوسبة غير خطية لكل موضع تكمّل خلط المواضع في الانتباه. ويبدو أن طبقات التغذية الأمامية تخزّن المعرفة الواقعية على هيئة ذاكرة ترابطية.
- تتفوق المحوّلات على الشبكات التكرارية لأن (1) جميع المواضع تُدرَّب بالتوازي، (2) طول المسار بين أي موضعين ثابت عند 1، (3) الأداء يتبع قوانين قوة قابلة للتنبؤ في الحوسبة والبيانات. هذه الخصائص تجعل المحوّل فريدًا للنظام التدريبي واسع النطاق للنماذج التأسيسية الحديثة.
- القيد الرئيسي هو تعقيد الانتباه O(n²). يعالج FlashAttention والانتباه المتفرق والانتباه الخطي هذا مع الحفاظ على معظم التعبيرية، مما يُتيح للبنى الشبيهة بالمحوّل التعامل مع تسلسلات أطول بكثير.