نماذج المحوّل الحديثة
بنية واحدة، أشكال متعددة — كيف أصبح مخطط المحوّل BERT وGPT وT5 وViT، مُعيدًا تشكيل معالجة اللغة الطبيعية والرؤية الحاسوبية معًا.
BERT — المشفِّر فقط
تمثيلات المشفِّر ثنائية الاتجاه من المحوّلات. يُدرَّب مسبقًا بـنمذجة اللغة بالإخفاء: التنبؤ بالرموز المُخفاة من السياق الأيسر والأيمن. يتعلم تمثيلات ثنائية الاتجاه عميقة مثالية لمهام الفهم.
دَرِّب مرةً، اضبط مرات
- RoBERTa: بيانات أكثر وتدريب أطول دون NSP — أقوى بكثير
- DistilBERT: أصغر بـ 40%، أسرع بـ 60%، يحتفظ بـ 97% من الأداء
- ALBERT: مشاركة المعاملات عبر الطبقات، بصمة أصغر بكثير
- DeBERTa: انتباه منفصل للمحتوى والموضع — رائد في GLUE وSuperGLUE
GPT — فكّ التشفير فقط
يُدرَّب انحداريًا ذاتيًا للتنبؤ بالرمز التالي. أظهر GPT-2 أداءً صفري اللقطات بـ 1.5 مليار معامل. كشف GPT-3 بـ 175 مليار معامل التعلم السياقي: أمثلة قليلة في النص المُوجِّه تعلّم مهام معقدة دون تحديث المعاملات.
RLHF والضبط بالتعليمات
- النماذج اللغوية الخام تتنبأ بالنصوص لكن لا تتبع التعليمات
- RLHF: مقيّمون بشريون يصنّفون المخرجات؛ PPO يُحسّن التفضيل
- InstructGPT → ChatGPT → GPT-4: الفكرة ذاتها بحجم متزايد
- الضبط بالتعليمات (دون RL) يحقق معظم المكاسب بشكل أبسط
T5 — نص إلى نص
محوّل مشفِّر-فكّ تشفير كامل. كل مهمة تصبح نصًا مدخلًا ونصًا مخرجًا: الترجمة، والتصنيف، والإجابة على الأسئلة، والتلخيص — نموذج واحد، خسارة واحدة، ضبط دقيق واحد. يُدرَّب مسبقًا على C4 بتلف الامتدادات. Flan-T5 يضيف أكثر من 1800 مهمة.
ViT — محوّل الرؤية
قسِّم الصورة إلى أجزاء 16×16، ضمِّن كلًا منها، أضف ترميزًا موضعيًا، وشغِّل مشفِّر محوّل قياسي. لا تلافيف. لا تحيّز محلي. في النطاق الصغير تتفوق الشبكات التلافيفية؛ في النطاق الكبير يتفوق ViT عليها.
Swin وDeiT وDINO
- DeiT: يدرّب ViT على ImageNet وحده بالتقطير — دون مجموعة بيانات ضخمة
- Swin: دمج أجزاء هرمي ونوافذ محلية ← ميزات متعددة الأحجام للكشف والتجزئة
- DINO/DINOv2: تعلم ذاتي الإشراف على ViT → ميزات تُعمَّم على العمق والتجزئة دون تسميات
دَرِّب مسبقًا وكيِّف
- المحوّلات الكبيرة المُدرَّبة على بيانات واسعة تصبح نقاط بداية شاملة
- CLIP: تعلم تبايني للرؤية واللغة ← تصنيف صوري صفري اللقطات
- GPT-4V وLLaVA: نماذج لغوية كبيرة موسّعة لقبول مدخلات الصور
- استراتيجيات التكييف: الضبط الدقيق، LoRA، هندسة التوجيه، RAG
ما تعلّمته
BERT (مشفِّر فقط، MLM)، وGPT (فكّ التشفير فقط، انحداري ذاتي)، وT5 (مشفِّر-فكّ تشفير، نص إلى نص)، وViT (أجزاء + مشفِّر محوّل) — جميعها بنية واحدة، مُهيَّأة بشكل مختلف. نماذج الأساس والتكييف بدلًا من إعادة التدريب هو النهج المعياري الآن.