من بنية إلى منظومة
كانت بنية المحوّل التي وصفها بحث “الانتباه هو كل ما تحتاجه” مخططًا للبناء، لا منتجًا نهائيًا. في السنوات التالية لنشره، اكتشف الباحثون أن النواة المعمارية ذاتها — طبقات الانتباه المتراكمة، والطبقات الأمامية، والاتصالات المتبقية، وتطبيع الطبقات — يمكن تكييفها لتُنتج عائلة متنوعة من النماذج، كل منها مُحسَّن لبيئة أو مهمة مختلفة.
احتفظت بعض النماذج بالمشفِّر فقط، متخلّيةً عن فكّ التشفير لتمكين الفهم الثنائي الاتجاه للنصوص. واكتفت نماذج أخرى بفكّ التشفير وحده، موسِّعةً التوليد التلقائي الانحداري إلى أحجام لم يتخيّلها أحد. وأعادت نماذج أخرى هيكلة العلاقة بين المشفِّر وفكّ التشفير لمعالجة مهام النص إلى نص بصورة موحّدة. وتجاوزت البنية ذاتها حدود اللغة لتهاجر إلى الرؤية الحاسوبية والصوت والوسائط المتعددة، فأظهرت عمومية لم يتوقعها أحد بالكامل في عام 2017.
يستعرض هذا الدرس عائلة المحوّلات الحديثة: BERT وأبناءه من نماذج المشفِّر فقط، وسلالة GPT من نماذج فكّ التشفير فقط، وT5 ونموذج المشفِّر-فكّ التشفير، ومحوّل الرؤية ViT. وحين تفهم كل صنف من هذه الأصناف — ما يحتفظ به، وما يتخلى عنه، ولماذا — تصبح في يدك خريطة ذهنية للمشهد الذي ستتنقل فيه كممارس.
BERT: تمثيلات المشفِّر ثنائية الاتجاه
في عام 2018، أصدر فريق ديفلين وزملاؤه في جوجل نموذج BERT (تمثيلات المشفِّر ثنائية الاتجاه من المحوّلات). كانت الفكرة الجوهرية بسيطة لكن بالغة الأثر: لمهام الفهم — كالتصنيف، والإجابة على الأسئلة، والتعرف على الكيانات المسمّاة — لا حاجة إلى التوليد؛ بل تحتاج إلى قراءة المدخلات كاملةً دفعةً واحدة وإنتاج تمثيل سياقي غني لكل رمز. والنموذج القائم على المشفِّر فقط، الذي يعالج الرموز بصورة ثنائية الاتجاه إذ يستطيع كل رمز أن ينتبه لجميع الرموز الأخرى، مثالي لهذا الغرض.
قدّم BERT هدف نمذجة اللغة بالإخفاء (MLM) كهدف للتدريب المسبق: خلال هذا التدريب، يُستبدَل 15% من رموز المدخلات بالرمز الخاص [MASK]، ويجب على النموذج أن يتنبأ بالرموز الأصلية استنادًا إلى السياق. ولأن النموذج يرى السياق الأيسر والأيمن معًا، فإنه يتعلم تمثيلات ثنائية الاتجاه عميقة تلتقط العلاقات النحوية والدلالية بثراء يتجاوز كل ما يقدر عليه نموذج أحادي الاتجاه.
ويستخدم BERT هدفًا ثانيًا للتدريب المسبق اسمه التنبؤ بالجملة التالية (NSP): أعطِ النموذج جملتين، وليتنبأ بما إذا كانت الثانية تلي الأولى في الوثيقة الأصلية. هذا يعلّمه التماسك بين الجمل. (وجدت أعمال لاحقة أن فائدة NSP محدودة، فأسقطه RoBERTa والنماذج التي تلته وحسّنوا تدريب MLM بدلًا منه.)
بعد التدريب المسبق على مجموعة بيانات ضخمة (ويكيبيديا الإنجليزية + BookCorpus، نحو 3.3 مليار كلمة)، يُضبَط BERT ضبطًا دقيقًا لكل مهمة لاحقة عبر إضافة رأس خاص بالمهمة (مثل مصنّف خطي على رمز [CLS]) وتدريبه بضع دورات على بيانات موسومة. وهذا النمط ذو المرحلتين — درّب مسبقًا مرة واحدة، ثم اضبط دقيقًا مرات كثيرة — صار المعيار في معالجة اللغة الطبيعية، ثم في وسائط أخرى بعدها. حقّق BERT-large (340 مليون معامل) نتائج رائدة في 11 معيارًا للغة الطبيعية في آنٍ واحد عند إصداره، وهو برهان لافت على قوة نقل التعلم.
توسّعت عائلة BERT بسرعة: أظهر RoBERTa (فيسبوك، 2019) أن BERT كان يُدرَّب بأقل من طاقته الكاملة؛ فاستخدام بيانات أكثر ودفعات أكبر وتدريب أطول مع حذف هدف التنبؤ بالجملة التالية حسّن الأداء تحسينًا ملحوظًا دون تغيير البنية. وطبّق DistilBERT التقطير المعرفي لإنتاج نموذج أصغر بنسبة 40% وأسرع بنسبة 60% من BERT-base مع الاحتفاظ بـ 97% من أدائه. واستخدم ALBERT مشاركة المعاملات بين الطبقات ليقلّص عدد المعاملات تقليصًا هائلًا. وقدّم DeBERTa الانتباه المنفصل (تمثيلان مستقلان للمحتوى والموضع) ومفكّك إخفاء مُحسَّنًا، فحقّق نتائج رائدة في معياري GLUE وSuperGLUE حتى عام 2021.
GPT: سلالة فكّ التشفير فقط
بينما كان BERT يُحسِّن الفهم، كانت شركة OpenAI تسعى للإجابة عن سؤال مختلف: إلى أي حد يستطيع نموذج قائم على فكّ التشفير فحسب — مُدرَّب على التنبؤ بالرمز التالي بصورة انحدارية ذاتية — توليد نصوص متماسكة؟ والإجابة تبيّنت أنه يفعل ذلك بشكل استثنائي، ويتحسن أكثر مع الحجم.
أثبت GPT-1 (2018) أن التدريب المسبق غير الخاضع للإشراف على مجموعة نصية ضخمة، يليه ضبط دقيق خاضع للإشراف، يمكنه التفوق على النماذج المصمَّمة خصيصًا لمهام متعددة في اللغة الطبيعية. وكان هدف التدريب بسيطًا: تعظيم أرجحية كل رمز بمعرفة كل الرموز السابقة له. لا إخفاء، ولا سياق ثنائي الاتجاه — مجرد تنبؤ من اليسار إلى اليمين، وهو الهدف نفسه المستخدم في نمذجة اللغة منذ عصر نماذج n-gram.
ورفع GPT-2 (2019) عدد المعاملات إلى 1.5 مليار، وكشف عن شيء مثير للدهشة: نموذج لغوي مُدرَّب فقط على التنبؤ بالرمز التالي، دون أي ضبط دقيق للمهمة، يمكنه أداء مهام لاحقة كثيرة بكفاءة معقولة بمجرد توجيهه بالطريقة الصحيحة. كانت هذه أولى الإشارات الواضحة على القدرات الناشئة: قدرات تنبثق من الحجم لا من تدريب صريح عليها. وكان توليد GPT-2 للنصوص سلسًا إلى حدّ أثار القلق من سوء استخدامه، فأصدرته OpenAI على مراحل.
جاء GPT-3 (2020) بـ 175 مليار معامل، مُدرَّبًا على نحو 300 مليار رمز. كانت القفزة في القدرة نوعية لا كميّة فحسب. يستطيع GPT-3 إجراء استدلالات معقدة، وكتابة الأكواد، والترجمة، والتلخيص، والإجابة على الأسئلة — كل ذلك من أمثلة قليلة مُدرجة في النص المُوجِّه دون أي تحديث للمعاملات. هذه القدرة على التعلم السياقي بأمثلة قليلة أظهرت نوعًا من الميتا-تعلم نشأ من الحجم وحده.
النماذج اللغوية الخام كـ GPT-3 بارعة في التنبؤ بالنصوص، لكنها لا تتبع التعليمات بالضرورة. عالج InstructGPT (2022) هذا الأمر عبر تعلم التعزيز من التغذية الراجعة البشرية (RLHF): صنّف مقيّمون بشريون مخرجات النموذج من حيث الجودة والفائدة، ثم ضُبط النموذج بخوارزمية PPO لتعظيم تفضيل الإنسان المتوقع. جعل هذا نماذج فئة GPT-3 أنفع بكثير وأكثر توافقًا مع مقاصد المستخدم. وهذا هو الأساس الذي يقوم عليه ChatGPT وGPT-4 ومعظم النماذج اللغوية الكبيرة المتبعة للتعليمات. أما الضبط بالتعليمات — أي الضبط الدقيق على مجموعات من أزواج (تعليمة، استجابة) دون تعلم تعزيز — فيوفّر بديلًا أبسط يحقق كثيرًا من التحسّن نفسه.
T5: محوّل النقل من نص إلى نص
يستخدم BERT بنية المشفِّر فقط، وهي مُحسَّنة للفهم. ويستخدم GPT بنية فكّ التشفير فقط، وهي مُحسَّنة للتوليد. وفي عام 2019، أصدرت جوجل نموذج T5 (محوّل النقل من نص إلى نص)، الذي دعا إلى إطار موحّد: صياغة كل مهمة في معالجة اللغة الطبيعية كمشكلة نص-إلى-نص، واستخدام محوّل المشفِّر-فكّ التشفير الكامل لكل شيء.
في إطار T5، تصبح الترجمة “ترجم الإنجليزية إلى الألمانية: [المصدر]” ← “[الترجمة]”. والتصنيف يصبح “المشاعر: [النص]” ← “إيجابي” أو “سلبي”. والإجابة على الأسئلة تصبح “سؤال: [س] سياق: [ج]” ← “[الجواب]”. والتلخيص يصبح “لخّص: [الوثيقة]” ← “[الملخص]”. النموذج ذاته، ودالة الخسارة ذاتها (الإنتروبيا المتقاطعة على رموز الخرج)، وإجراء الضبط الدقيق ذاته يُطبَّق على كل المهام. وهذا التوحيد أنيق ومفيد عمليًا: يبسّط خط الهندسة، ويتيح للنموذج أن يتشارك التمثيلات بين المهام.
دُرِّب T5 مسبقًا على مجموعة C4 (المجموعة العملاقة المنقّاة الزاحفة)، وهي نسخة ضخمة مُرشَّحة من Common Crawl، باستخدام هدف تلف الامتدادات: تُستبدَل امتدادات عشوائية من الرموز برمز حارس واحد، ويجب على النموذج التنبؤ بالامتدادات الأصلية. وهذا تعميم لنمذجة اللغة بالإخفاء في BERT إلى إطار توليدي — إذ يُنتج فكّ التشفير الامتدادات التالفة بدلًا من التنبؤ بالرموز في مواضعها.
حقّق T5-11B (11 مليار معامل) نتائج رائدة في طائفة واسعة من معايير اللغة الطبيعية. وأرسَت عائلة T5 كذلك أهمية تنقية البيانات بعناية: فخيارات ترشيح C4 (إزالة التكرار، وترشيح الجودة، وحذف المحتوى المسيء) تؤثر تأثيرًا كبيرًا في جودة النموذج النهائية. وضبط Flan-T5 (2022) نموذج T5 ضبطًا دقيقًا على أكثر من 1800 مهمة مصوغة كتعليمات، فأنتج نموذجًا يُعمِّم على مهام جديدة من التعليمات وحدها بمهارة استثنائية.
محوّل الرؤية (ViT)
صُمِّم المحوّل لمتتاليات من الرموز المنفصلة. أما الصور فمتصلة وثنائية الأبعاد — بنية مختلفة اختلافًا جوهريًا. ولثلاث سنوات بعد بحث المحوّل الأصلي، ظلت الشبكات العصبية التلافيفية مهيمنة على الرؤية الحاسوبية. ثم في عام 2020، أثبت دوسوفيتسكي وزملاؤه أن محوّلًا خالصًا، يُطبَّق مباشرةً على متتاليات من أجزاء الصور بأدنى تعديل، يمكنه مجاراة أداء الشبكات التلافيفية أو تجاوزه في تصنيف الصور عند التدريب بنطاق كافٍ. كانت النتيجة محوّل الرؤية (ViT).
الفكرة الجوهرية هي تضمين الأجزاء: تقسيم الصورة إلى شبكة من الأجزاء غير المتداخلة (مثلًا 16×16 بكسل لكل جزء)، وتسطيح كل جزء إلى متجه، وإسقاطه خطيًا إلى البعد dmodel. ثم يُضاف رمز [CLS] قابل للتعلم في بداية المتتالية، وتُضاف تضمينات موضعية (تضمينات موضعية أحادية البعد يتعلّمها النموذج لمواضع الأجزاء)، وتُغذَّى المتتالية الناتجة عبر مشفِّر محوّل قياسي. ويُستخدم تمثيل رمز [CLS] عند الخرج للتصنيف عبر رأس خطي.
لا يحتوي ViT على تلافيفات ولا تحيّزات استقرائية محلية — فهو، بخلاف الشبكات التلافيفية، لا يفترض أن البكسلات المتجاورة أوثق صلة من البعيدة. هذا ضعف وقوة في آنٍ واحد: في نطاق البيانات الصغير تتفوق الشبكات التلافيفية، لأن التحيّز المحلي في التلافيف احتمال مسبق مفيد للصور؛ لكن في نطاق البيانات الكبير (JFT-300M: 300 مليون صورة) يتفوق ViT عليها أو يساويها. الدرس يعكس قصة GPT-3: عند الحجم الكافي، تصبح التحيّزات الاستقرائية أقل أهمية من قدرة النموذج على تعلم البنية من البيانات.
أظهر DeiT إمكانية تدريب ViT بفعالية على ImageNet وحده (دون مجموعات تدريب مسبق هائلة) باستخدام تعزيز البيانات القوي والتقطير المعرفي من شبكة تلافيفية معلّمة. وأضاف Swin Transformer دمج الأجزاء الهرمي ونوافذ الانتباه المحلية، مما يمنح ViT خرائط الميزات متعددة المقاييس التي تستخدمها الشبكات التلافيفية — وهي ضرورية لمهام التنبؤ الكثيف كالكشف عن الأشياء والتجزئة. أما DINO وDINOv2 فيستخدمان التعلم الذاتي الإشراف على ViT، مُنتجَين ميزات بصرية تنبثق دون أي تسميات وتُعمَّم على المهام بصورة لافتة. وميزات DINOv2 المدرَّبة على صور الإنترنت تحقق تقدير عمق وتجزئة واسترجاعًا يقارب الكمال بمجرد مسبار خطي — دليل على أن التدريب المسبق الذاتي الإشراف واسع النطاق لـ ViT يقترب من جودة ميزات ImageNet الخاضعة للإشراف عند أي نطاق.
نظرة موحَّدة: نماذج الأساس
BERT وGPT وT5 وViT ليست اختراعات منفصلة؛ بل هي تخصصات لمخطط معماري واحد — المحوّل — مكيَّف لوسائط وأهداف تدريب مختلفة. هذا التقارب نحو بنية واحدة عبر الوسائط له اسم: نماذج الأساس. نموذج الأساس هو نموذج كبير يُدرَّب على بيانات واسعة النطاق، ويمكن تكييفه لمجموعة واسعة من المهام اللاحقة.
النتيجة العملية هي أن الميدان انتقل من تدريب نماذج خاصة بالمهام من الصفر إلى تكييف نماذج الأساس المُدرَّبة مسبقًا. بدلًا من تصميم بنية جديدة لكل مشكلة، يختار الممارسون الآن نموذج أساس مناسبًا، واستراتيجية تكييف (الضبط الدقيق، أو هندسة التوجيه، أو التعزيز بالاسترجاع، أو الضبط الدقيق الموفّر للمعاملات عبر LoRA أو المهايئات)، ثم ينشرون. وجودة التمثيلات المُدرَّبة مسبقًا ترفع بشكل هائل السقف الممكن بلوغه ببيانات موسومة قليلة.
وتوسّع النماذج المتعددة الوسائط هذا أبعد من ذلك. درّب CLIP (رادفورد وزملاؤه، 2021) مشفِّر رؤية ومشفِّر نص معًا على 400 مليون زوج صورة-تعليق بالتعلم التبايني، فتعلّم فضاء تضمين مشتركًا تقع فيه الصور قريبة من أوصافها النصية. وتمثيلات CLIP للصور تُنقَل إلى المهام اللاحقة بنجاح كبير، وتتيح تصنيف الصور الصفري: أعطِه صورة، وسيصنّفها بإيجاد الوصف النصي الأقرب إليها في فضاء تضمين CLIP، دون الحاجة إلى أي صور موسومة. وتُوسّع GPT-4V وLLaVA ونماذج مشابهة النماذج اللغوية من فئة GPT لتقبل مدخلات الصور، فتمكّن الإجابة البصرية على الأسئلة، ووصف الصور، وفهم المستندات.
المسار واضح: المحوّلات في طريقها إلى أن تصبح البنية الشاملة، تمامًا كما صارت الشبكات العصبية العميقة المُقرِّب الشامل للدوال قبل عقد من الزمن. لم يبقَ السؤال “هل أستخدم محوّلًا؟”، بل صار “أي صنف من المحوّلات، مُدرَّب مسبقًا على أي بيانات، ومكيَّف بأي تقنية؟”
- يستخدم BERT محوّلات المشفِّر فقط مع نمذجة اللغة بالإخفاء للتدريب المسبق لتعلم تمثيلات ثنائية الاتجاه العميقة. يُضبَط دقيقًا لمهام الفهم (التصنيف، والإجابة على الأسئلة، والتعرف على الكيانات المسمّاة). RoBERTa وDistilBERT وALBERT وDeBERTa هي نسل رئيسي له.
- يستخدم GPT محوّلات فكّ التشفير فقط مُدرَّبة على التنبؤ الانحداري الذاتي بالرمز التالي. كشفت الزيادة في الحجم من GPT-1 إلى GPT-2 ثم GPT-3 عن قدرة التعلم السياقي الناشئة. تجعل محاذاة RLHF (InstructGPT وChatGPT) النماذج اللغوية الخام تتبع التعليمات. ووسّع GPT-4 هذا إلى المدخلات المتعددة الوسائط.
- يوحّد T5 جميع مهام اللغة الطبيعية كمشاكل نص-إلى-نص باستخدام محوّل المشفِّر-فكّ التشفير الكامل المُدرَّب مسبقًا بتلف الامتدادات على مجموعة C4. يضيف Flan-T5 الضبط بالتعليمات عبر أكثر من 1800 مهمة.
- يُطبّق محوّل الرؤية (ViT) مشفِّر محوّل قياسي على متتاليات من أجزاء الصور. يحتاج إلى تدريب مسبق واسع النطاق لمجاراة الشبكات التلافيفية، لكن عند الحجم الكافي يتفوق عليها. يضيف Swin التسلسل الهرمي؛ ويستخدم DINO التعلم الذاتي الإشراف لميزات بصرية قوية.
- نماذج الأساس — المحوّلات الكبيرة المُدرَّبة على بيانات واسعة — هي الآن نقطة البداية المعيارية. تُحدد استراتيجيات التكييف (الضبط الدقيق، LoRA، هندسة التوجيه، RAG) جودة النشر. يُوسّع CLIP والنماذج المتعددة الوسائط هذا النهج عبر الوسائط.
- أصبح المحوّل البنية المعمارية الشاملة. فهم متغيرات المشفِّر فقط، وفكّ التشفير فقط، والمشفِّر-فكّ التشفير، ومتى يكون كل منها مناسبًا، هو الآن معرفة أساسية لكل ممارس في تعلم الآلة.