من المتجهات الثابتة إلى البحث الديناميكي
في نهاية الوحدة الثامنة، رأينا كيف تضغط بنية الترميز–فك الترميز التسلسل المدخل بأكمله في متجه سياق واحد ذي حجم ثابت، ثم تستخدم هذا المتجه لتهيئة فاك الترميز. هذا التصميم أنيق لكنه يحمل عنق زجاجة جوهرية: بالنسبة لتسلسل مدخل طويل، يجب ضغط كل دقائق المعنى في متجه من ربما 512 رقمًا. تضيع المعلومات الحرجة حتمًا مع نمو طول التسلسل، وتتراجع جودة الترجمة وفق ذلك.
حلّت آلية الانتباه، التي قدّمها بهداناو وتشو وبنجيو عام 2015، هذه المشكلة بالتخلي تمامًا عن عنق الزجاجة ذي المتجه الواحد. بدلًا من ضغط المدخل مرة واحدة وإلى الأبد، يُمنح فاك الترميز وصولًا مباشرًا إلى كل حالة مخفية في الترميز في كل خطوة من خطوات فك الترميز. فهو يُركّز انتباهه على الحالات الأكثر صلة بتوليد رمز المخرجات الحالي، منتبهًا لبعض المواضع أكثر من غيرها. تبيّن أن عملية البحث الناعمة القابلة للتفاضل هذه كانت من أكثر الأفكار أثرًا في تعلم الآلة الحديث.
يطوّر هذا الدرس آلية الانتباه من المبادئ الأولى: الحدس الكامن وراء الاسترجاع الموزون، والصياغة الرسمية للاستعلام–المفتاح–القيمة، وانتباه حاصل الضرب القياسي المُعيَّر، وانتباه متعدد الرؤوس، والانتباه الذاتي، والانتباه المتقاطع. تشكّل هذه المفاهيم المفردات الكاملة اللازمة لفهم بنية المحوّل في الدرس التالي.
الانتباه باعتباره استرجاعًا موزونًا للمعلومات
تخيّل مكتبة تحتوي على N كتابًا (حالات الترميز المخفية h1, …, hN). أنت تصل بسؤال (الحالة الحالية لفاك الترميز st) وتريد استرجاع المعلومات الأكثر صلة. النهج الساذج هو قراءة جميع الكتب بأوزان متساوية. النهج الأفضل هو إسناد درجة صلة لكل كتاب، وتطبيع هذه الدرجات في توزيع احتمالي، وتشكيل ملخص موزون للمحتوى — فتقرأ الكتب الأكثر صلة بتمعّن وتتصفّح الباقي سريعًا.
وهذا تمامًا ما يفعله الانتباه. تقيس درجة المحاذاة etj مدى تطابق الحالة الحالية لفاك الترميز مع الحالة المُرمِّزة hj. ينتج عن تطبيق softmax على جميع درجات المحاذاة أوزان انتباه αtj تجمع إلى 1 عبر جميع مواضع الترميز j. متجه السياق ct هو المجموع الموزون لحالات الترميز بتلك الأوزان. يولّد فاك الترميز بعد ذلك رمز المخرجات التالي باستخدام حالته المخفية st ومتجه السياق هذا ct معًا.
والأهم من ذلك، أن أوزان الانتباه قابلة للتفاضل: تتدفق التدرجات للخلف عبر softmax وشبكة المحاذاة، مما يدرّب النموذج على إنتاج أنماط انتباه جيدة دون أي إشراف صريح على المكان الذي ينبغي النظر إليه. يتعلم النموذج أي المواضع يهتم بها بشكل خالص من هدف المهمة (مثل التنبؤ بالرمز التالي أو دقة الترجمة).
الانتباه بأسلوب بهداناو هو انتباه ناعم: متجه السياق هو متوسط موزون عبر جميع المواضع، لذا تسهم كل حالة ترميز (بأوزان مختلفة). الانتباه الصلب يختار موضعًا واحدًا بالضبط في كل خطوة، وهي عملية متقطعة غير قابلة للتفاضل. الانتباه الصلب أسهل في التفسير، لكن تدريبه يحتاج إلى التعلم المعزز أو حيلة REINFORCE، وهذا أقل استقرارًا. الانتباه الناعم هو النهج السائد لأنه قابل للتفاضل تمامًا ويتكامل مع الانتشار العكسي بسلاسة.
تجريد الاستعلام–المفتاح–القيمة
استخدمت صياغة بهداناو الأصلية شبكة محاذاة مُتعلمة لحساب درجات الصلة. وأعادت ورقة فاسواني وآخرون (2017) — ورقة “الانتباه هو كل ما تحتاجه” — صياغة الانتباه بشكل أكثر عمومية وكفاءة حسابية باستخدام ثلاث إسقاطات خطية: الاستعلامات (Q)، والمفاتيح (K)، والقيم (V).
الحدس مستوحى من استرجاع المعلومات: عندما تبحث في قاعدة بيانات، تُقارَن استعلامك بـمفاتيح في قاعدة البيانات، والمفاتيح المطابقة تُعيد قيمها المرتبطة. في الانتباه العصبي، الثلاثة جميعها متجهات متصلة يتعلمها النموذج. كل موضع مدخل ينتج مفتاحًا (ما أحتويه) وقيمة (ما أعيده إذا اخترت). كل موضع استعلام يسأل (ماذا أبحث عن؟). تُقاس الصلة بحاصل الضرب النقطي بين استعلام وكل مفتاح. والمخرج هو المجموع الموزون للقيم، وتأتي الأوزان من تشابهات الاستعلام–المفتاح.
بشكل ملموس، بالنظر إلى مصفوفات المدخل X (الشكل: طول التسلسل × بُعد النموذج dmodel)، تُسقط ثلاث مصفوفات أوزان مُتعلمة WQ, WK, WV المدخلات في فضاءات الاستعلام والمفتاح والقيمة: Q = XWQ, K = XWK, V = XWV. هذا الإسقاط الخطي غير مكلف حسابيًا ويُتيح معالجة جميع المواضع بالتوازي كعمليات مصفوفية — وهذه ميزة جوهرية على الشبكات التكرارية التي تعمل موضعًا بعد موضع.
انتباه حاصل الضرب القياسي المُعيَّر
بعد الحصول على Q وK وV، يُحسب مخرج الانتباه كما يلي:
عامل القياس √dk حرج. عندما يكون dk كبيرًا (64 أو 128 مثلًا)، تكون حواصل الضرب العشوائية بين متجهات الاستعلام والمفتاح ذات التوزيع الطبيعي الوحدوي لها تباين dk، أي أن مقدارها ينمو مع البُعد. بدون التعيير، تجعل هذه القيم الكبيرة softmax شبه متجهة وحدوية، مما يُعطّل التدرج ويُبطئ التدريب. القسمة على √dk تُعيد التباين الوحدوي وتُبقي التدرجات سليمة طوال التدريب.
يمكن إضافة قناع اختياري قبل softmax. للانتباه السببي (الذاتي التراجعي)، يُعيّن القناع المواضع المستقبلية إلى −∞ بحيث يمكن لكل موضع الانتباه فقط للمواضع السابقة، مما يُطبّق الخاصية الذاتية التراجعية المطلوبة لتوليد اللغة: لا يستطيع النموذج أن “يرى” الرموز المستقبلية وهو يتنبأ بالرمز الحالي. وللحشو، يُعيّن القناع مواضع الحشو إلى −∞ حتى لا تُسهم في أوزان الانتباه.
أحد أسباب هيمنة انتباه حاصل الضرب القياسي المُعيَّر هو كفاءته الحسابية. حساب QK³ هو ضرب مصفوفي واحد، وهي عملية محسّنة للغاية على وحدات GPU/TPU الحديثة. أما شبكة المحاذاة في انتباه بهداناو فتتطلب تشغيل شبكة تغذية أمامية لكل زوج من (موضع في فاك الترميز، موضع في الترميز)، أي O(Tout × Tin) عملية تسلسلية. يحسب انتباه حاصل الضرب القياسي جميع التشابهات بالتوازي كضرب مصفوفي، مما يُتيح تدريبًا متوازيًا للغاية عبر جميع مواضع التسلسل في آنٍ واحد.
الانتباه متعدد الرؤوس
رأس انتباه واحد يمكنه تعلم نوع واحد من علاقات الصلة — التوافق النحوي مثلًا، أو التشابه الدلالي. لكن اللغة وغيرها من البيانات التسلسلية مبنية على طرق متعددة متشابكة في الوقت نفسه. الانتباه متعدد الرؤوس يُشغّل h عملية انتباه مستقلة بالتوازي، لكل منها إسقاطاتها الخاصة من Q وK وV، مما يُتيح للنموذج الانتباه المشترك إلى المعلومات من فضاءات تمثيل فرعية مختلفة.
تجريبيًا، تتخصص رؤوس الانتباه المختلفة في أنماط لغوية مختلفة. في النماذج اللغوية المُدرَّبة، تتتبع بعض الرؤوس البنية النحوية (توافق الفاعل والفعل، والإحالة المرجعية)، وأخرى تتتبع القرب الموضعي، وأخرى تنتبه لكلمات ذات صلة دلالية بصرف النظر عن الموضع. هذا التخصص يظهر بحتًا من التدريب على التنبؤ بالرمز التالي دون أي إشراف صريح على ما ينبغي أن يفعله كل رأس.
دمج مخرجات الرؤوس h (كل منها ببُعد dk) يُنتج متجهًا ببُعد h×dk = dmodel. والإسقاط النهائي WO يخلط المعلومات بين الرؤوس، فيستطيع النموذج أن يجمع أنماط العلاقات المختلفة التي اكتشفها كل رأس في تمثيل واحد موحّد يُسلّمه للطبقة التالية.
الانتباه الذاتي: الانتباه لتسلسلك الخاص
في سياق الترميز–فك الترميز، سمح الانتباه لفاك الترميز باستعلام حالات الترميز. لكن يمكن تطبيق نفس الآلية داخل تسلسل واحد: الانتباه الذاتي (ويُسمى أيضًا الانتباه الداخلي) يُتيح لكل موضع في تسلسل الانتباه لكل موضع آخر في نفس التسلسل. Q وK وV جميعها مشتقة من نفس المدخل X.
يحسب الانتباه الذاتي تمثيلًا غنيًا واعيًا بالسياق لكل رمز عن طريق تجميع المعلومات من جميع الرموز الأخرى. خُذ كلمة “bank” في جملة إنجليزية: يستطيع الانتباه الذاتي أن يجمع في وقت واحد أدلة من “river” (فتُرجّح المعنى الجغرافي: الضفة) أو من “loan” (فتُرجّح المعنى المالي: المصرف)، ويوزن كل قرينة سياقية بحسب صلتها بحل الغموض. هذه الحساسية للسياق تُكتسب بالكامل من البيانات — فالنموذج يبني مفهومه الخاص للصلة انطلاقًا من هدف التدريب.
على عكس الحالات المخفية في الشبكات التكرارية التي تُحسب بشكل تسلسلي (الموضع t يعتمد على الموضع t−1)، يُحسب الانتباه الذاتي بالتوازي عبر جميع المواضع. كل موضع يستعلم بشكل مستقل جميع المواضع الأخرى ويُجمّع متجه سياقه. هذا التوازي هو السبب الرئيسي لتدريب المحوّلات بشكل أسرع بكثير من الشبكات التكرارية على الأجهزة الحديثة، حيث التوازي المصفوفي هو المورد الحسابي الأول.
للانتباه الذاتي تعقيد زمني ومكاني O(n²d)، حيث n هو طول التسلسل و d هو بُعد النموذج. يجب حساب مصفوفة الانتباه n×n وتخزينها لكل طبقة ولكل رأس. للتسلسلات ذات طول 512، هذا معقول. للتسلسلات الطويلة جدًا (وثائق من آلاف الرموز، أو صور عالية الدقة)، تصبح التكلفة التربيعية عقبة. تعالج أبحاث الانتباه المتفرق والانتباه الخطي والانتباه المُقسَّم إلى كتل (مثل FlashAttention) هذا القيد مع الحفاظ على معظم قدرة الانتباه الكامل على التعبير. يعود الدرس التالي إلى عنق الزجاجة التربيعي هذا عند مقارنة كيفية تحجيم المحوّلات والشبكات التكرارية.
الانتباه المتقاطع: الانتباه لتسلسل آخر
الانتباه المتقاطع هو التعميم الذي يربط تسلسلين مختلفين. تأتي الاستعلامات من تسلسل واحد (مثلًا فاك الترميز)، بينما تأتي المفاتيح والقيم من آخر (مثلًا الترميز). هذا تمامًا نمط الانتباه بين الترميز وفاك الترميز: يستعلم فاك الترميز تمثيلات الترميز لاستخراج المعلومات التي يحتاجها لتوليد كل رمز مخرجات.
يتعمم الانتباه المتقاطع بشكل طبيعي خارج الترجمة. في توصيف الصور، تنتبه الاستعلامات من فاك ترميز اللغة للميزات البصرية المستخرجة بترميز الرؤية. في التعرف على الكلام، تنتبه الاستعلامات من فاك ترميز النص لتمثيلات ترميز الصوت. في الإجابة على الأسئلة من الوثائق، تنتبه الاستعلامات من فاك ترميز الجواب لتمثيلات الوثيقة. أينما يتفاعل تسلسلان أو طريقتان، يوفّر الانتباه المتقاطع الآلية.
التمييز بين الانتباه الذاتي والانتباه المتقاطع هو بنيوي وليس رياضيًا. كلاهما يستخدم نفس معادلة حاصل الضرب القياسي المُعيَّر. الفرق الوحيد هو مصدر Q وK وV: نفس التسلسل للانتباه الذاتي، وتسلسلات مختلفة للانتباه المتقاطع. هذا التوحيد من أجمل ما في المحوّل — بدائية واحدة تتركّب فيها التفاعلات داخل التسلسل وبين التسلسلات معًا.
ملاحظة حول الموضع
الانتباه الذاتي متماثل التباديل: خلط رموز المدخل ينتج نفس مخرجات الانتباه بنفس الترتيب المخلوط. الآلية لا تمتلك مفهومًا جوهريًا للموضع — الانتباه للموضع 1 يبدو في معادلة الانتباه مثل الانتباه للموضع 100 تمامًا. وهذا على عكس الشبكات التكرارية حيث يُشفَّر الموضع ضمنيًا بالترتيب الذي تُحسب به الحالات المخفية.
لحقن معلومات الموضع، تُضيف المحوّلات ترميزات موضعية إلى تضمينات المدخل قبل أي طبقة انتباه. استخدم المحوّل الأصلي دوال جيبية بترددات مختلفة لإنتاج ترميز فريد لكل موضع. النماذج الحديثة غالبًا ما تستخدم تضمينات موضعية مُتعلمة، أو ترميزات موضعية نسبية تُحيّز درجات الانتباه مباشرة بحسب المسافة بين المواضع. سنفحص الترميز الموضعي بالتفصيل في الدرس 9.2 حين ندرس بنية المحوّل كاملة.
- يتجاوز الانتباه عنق الزجاجة ذا المتجه الثابت في الشبكات التكرارية بإتاحة وصول مباشر وموزون لجميع الحالات المخفية في الترميز في كل خطوة فك ترميز. تُحسب الأوزان بدالة محاذاة قابلة للتعلم وتُطبَّع بـ softmax.
- يُعيد تجريد الاستعلام–المفتاح–القيمة صياغة الانتباه كاسترجاع معلومات قابل للتفاضل: الاستعلامات تسأل عما تبحث عنه، والمفاتيح تصف ما يحتويه كل موضع، والقيم تحمل المعلومات الفعلية. الثلاثة جميعها إسقاطات خطية للمدخل.
- يحسب انتباه حاصل الضرب القياسي المُعيَّر جميع تشابهات الاستعلام–المفتاح كضرب مصفوفي واحد ويقسم على √dk لمنع تشبع التدرج. يُطبّق القناع القيود السببية أو يتجاهل الحشو.
- يُشغّل الانتباه متعدد الرؤوس h رؤوس انتباه مستقلة بالتوازي، كل منها يُسقط في فضاء فرعي أصغر أبعادًا. تتعلم الرؤوس التخصص في أنواع علاقات مختلفة (نحوية، ودلالية، وموضعية). تُدمج مخرجاتها وتُسقط إلى dmodel.
- يُطبّق الانتباه الذاتي نفس الآلية داخل تسلسل واحد، مما يُتيح لكل موضع الانتباه لكل موضع آخر في وقت واحد وبالتوازي، على عكس الشبكات التكرارية التي تعالج المواضع بشكل تسلسلي. هذا التوازي هو ميزة الكفاءة الأساسية في المحوّلات.
- يربط الانتباه المتقاطع تسلسلين عن طريق توجيه الاستعلامات من أحدهما والمفاتيح والقيم من الآخر، مما يوفر إطارًا موحدًا لتفاعل الترميز–فك الترميز والدمج متعدد الطرائق وما هو أبعد.