ML 101
M09 · L03
الوحدة 9

نماذج المحوّل الحديثة

بنية واحدة، أشكال متعددة — كيف أصبح مخطط المحوّل BERT وGPT وT5 وViT، مُعيدًا تشكيل معالجة اللغة الطبيعية والرؤية الحاسوبية معًا.

01 / 11
ML 101
M09 · L03
جوجل، 2018

BERT — المشفِّر فقط

تمثيلات المشفِّر ثنائية الاتجاه من المحوّلات. يُدرَّب مسبقًا بـنمذجة اللغة بالإخفاء: التنبؤ بالرموز المُخفاة من السياق الأيسر والأيمن. يتعلم تمثيلات ثنائية الاتجاه عميقة مثالية لمهام الفهم.

المعاملات (كبير)
340M
المعايير
11 SOTA
02 / 11
ML 101
M09 · L03
عائلة BERT

دَرِّب مرةً، اضبط مرات

  • RoBERTa: بيانات أكثر وتدريب أطول دون NSP — أقوى بكثير
  • DistilBERT: أصغر بـ 40%، أسرع بـ 60%، يحتفظ بـ 97% من الأداء
  • ALBERT: مشاركة المعاملات عبر الطبقات، بصمة أصغر بكثير
  • DeBERTa: انتباه منفصل للمحتوى والموضع — رائد في GLUE وSuperGLUE
03 / 11
ML 101
M09 · L03
OpenAI، 2018–2020

GPT — فكّ التشفير فقط

يُدرَّب انحداريًا ذاتيًا للتنبؤ بالرمز التالي. أظهر GPT-2 أداءً صفري اللقطات بـ 1.5 مليار معامل. كشف GPT-3 بـ 175 مليار معامل التعلم السياقي: أمثلة قليلة في النص المُوجِّه تعلّم مهام معقدة دون تحديث المعاملات.

04 / 11
ML 101
M09 · L03
المحاذاة

RLHF والضبط بالتعليمات

  • النماذج اللغوية الخام تتنبأ بالنصوص لكن لا تتبع التعليمات
  • RLHF: مقيّمون بشريون يصنّفون المخرجات؛ PPO يُحسّن التفضيل
  • InstructGPT → ChatGPT → GPT-4: الفكرة ذاتها بحجم متزايد
  • الضبط بالتعليمات (دون RL) يحقق معظم المكاسب بشكل أبسط
05 / 11
ML 101
M09 · L03
جوجل، 2019

T5 — نص إلى نص

محوّل مشفِّر-فكّ تشفير كامل. كل مهمة تصبح نصًا مدخلًا ونصًا مخرجًا: الترجمة، والتصنيف، والإجابة على الأسئلة، والتلخيص — نموذج واحد، خسارة واحدة، ضبط دقيق واحد. يُدرَّب مسبقًا على C4 بتلف الامتدادات. Flan-T5 يضيف أكثر من 1800 مهمة.

06 / 11
ML 101
M09 · L03
Google Brain، 2020

ViT — محوّل الرؤية

قسِّم الصورة إلى أجزاء 16×16، ضمِّن كلًا منها، أضف ترميزًا موضعيًا، وشغِّل مشفِّر محوّل قياسي. لا تلافيف. لا تحيّز محلي. في النطاق الصغير تتفوق الشبكات التلافيفية؛ في النطاق الكبير يتفوق ViT عليها.

بيانات التدريب المسبق
JFT-300M: 300 مليون صورة
07 / 11
ML 101
M09 · L03
عائلة ViT

Swin وDeiT وDINO

  • DeiT: يدرّب ViT على ImageNet وحده بالتقطير — دون مجموعة بيانات ضخمة
  • Swin: دمج أجزاء هرمي ونوافذ محلية ← ميزات متعددة الأحجام للكشف والتجزئة
  • DINO/DINOv2: تعلم ذاتي الإشراف على ViT → ميزات تُعمَّم على العمق والتجزئة دون تسميات
08 / 11
ML 101
M09 · L03
نماذج الأساس

دَرِّب مسبقًا وكيِّف

  • المحوّلات الكبيرة المُدرَّبة على بيانات واسعة تصبح نقاط بداية شاملة
  • CLIP: تعلم تبايني للرؤية واللغة ← تصنيف صوري صفري اللقطات
  • GPT-4V وLLaVA: نماذج لغوية كبيرة موسّعة لقبول مدخلات الصور
  • استراتيجيات التكييف: الضبط الدقيق، LoRA، هندسة التوجيه، RAG
09 / 11
ML 101
اختبار سريع

تحقّق ممّا ترسّخ

أربعة أسئلة من هذا الدرس. أجب لترى السبب — يظهر الشرح سواء أصبت أم أخطأت. لا شيء يُحتسب أو يُحفظ.

السؤال 1 من 0
النتيجة 0/0

10 / 11
ML 101
ملخص
مراجعة

ما تعلّمته

BERT (مشفِّر فقط، MLM)، وGPT (فكّ التشفير فقط، انحداري ذاتي)، وT5 (مشفِّر-فكّ تشفير، نص إلى نص)، وViT (أجزاء + مشفِّر محوّل) — جميعها بنية واحدة، مُهيَّأة بشكل مختلف. نماذج الأساس والتكييف بدلًا من إعادة التدريب هو النهج المعياري الآن.

11 / 11