تعلم الآلة 101
و11 · د02
التعلم العميق التطبيقي

التعلم بالنقل والضبط الدقيق

مستودعات النماذج المدربة مسبقًا، واستخراج الميزات، وLoRA، والتعلم من أمثلة قليلة — إعادة استخدام المعرفة بدلًا من البدء من الصفر.

01 / 13
تعلم الآلة 101
و11 · د02
الفكرة الأساسية

لا تبدأ من الصفر

شبكة مدربة على 1.2 مليون صورة تعلّمت الحواف والنسيج والأشكال. ونموذج مدرب على مليارات الرموز يعرف النحو والحقائق والاستدلال. أعد استخدام هذه التمثيلات لمهمتك — ببيانات وحوسبة أقل بكثير.

لماذا ينجح النقل؟
الطبقات الأولى تتعلم ميزات عامة (حواف، ن-غرامات)؛ اللاحقة تتعلم تجريدات خاصة بالمهمة. فقط الطبقات الأخيرة تحتاج تكيفًا جوهريًا.
02 / 13
تعلم الآلة 101
و11 · د02
مستودع النماذج

المنظومة المدربة مسبقًا

  • رؤية CNN — ResNet وEfficientNet وConvNeXt (مدربة على ImageNet)
  • رؤية ViT — ViT وDeiT وCLIP (قائم على الرقع؛ تصنيف صفري)
  • لغة ترميز — BERT وRoBERTa (نمذجة محجوبة؛ الأفضل للتصنيف)
  • لغة فك ترميز — LLaMA وMistral وGPT-2 (الأفضل للتوليد)
  • Seq2Seq — T5 وBART (نص إلى نص؛ ترجمة وتلخيص)
  • متعدد الوسائط — BLIP-2 وLLaVA (رؤية + لغة مشتركة)
03 / 13
تعلم الآلة 101
و11 · د02
الاستراتيجية 1

استخراج الميزات

جمّد جميع الأوزان (requires_grad = False). أزل الرأس الأصلي. دُرِّب رأسًا جديدًا فوق التمثيلات الثابتة فقط.

العمود المجمّد
\hat{y}=W\cdot f_{\text{frozen}}(x)

الأنسب: بيانات صغيرة، نطاق مشابه. تدريب سريع — دقائق على وحدة المعالجة المركزية.

04 / 13
تعلم الآلة 101
و11 · د02
الاستراتيجية 2

الضبط الدقيق الكامل

أُلغِ تجميد جميع الأوزان وحدِّثها مع الرأس الجديد بـمعدل تعلم صغير. الأوزان المدربة مسبقًا تُستخدم كنقطة انطلاق لا كميزات ثابتة.

  • معدلات تعلم تفاضلية — أصغر للطبقات الأولى وأكبر للاحقة
  • إلغاء تجميد تدريجي — الغِ تجميد مجموعات الطبقات تباعًا
  • نسيان كارثي — استخدم معدل تعلم منخفض (1e-5) + إيقاف مبكر
  • جدول إحماء: 5–10% من الخطوات، ثم تناقص جيبي التمام
05 / 13
تعلم الآلة 101
و11 · د02
فجوة النطاق

التكيف مع النطاق

النطاقان المصدري والمستهدف مختلفان — نصوص عامة مقابل طبية، أو ImageNet مقابل صور أقمار. التمثيلات المدربة مسبقًا غير متوافقة.

DAPT
الاستمرار في التدريب المسبق على نصوص متخصصة
DA
مواءمة تعاكسية أو تدريب ذاتي بتصنيفات زائفة
06 / 13
تعلم الآلة 101
و11 · د02
بلا تحديث للتدرجات

التعلم الصفري وقليل الأمثلة

النماذج الكبيرة تعمّم وقت الاستدلال من وصف المهمة (صفري) أو أمثلة قليلة في السياق (قليل الأمثلة). لا تحديث للأوزان.

ICL مقابل الضبط الدقيق
مع >100–1000 مثال موسوم، يتفوق الضبط الدقيق على ICL. مع سياق فقط، ICL هو الخيار الوحيد لنماذج API.
07 / 13
تعلم الآلة 101
و11 · د02
LoRA

التكيف منخفض الرتبة

جمّد W₀. أضف مسارًا منخفض الرتبة قابلًا للتدريب: مصفوفتان صغيرتان A ∈ ℝ^{d×r} وB ∈ ℝ^{r×k} حيث r ≪ d,k. A وB فقط تُحدَّثان.

تمرير LoRA الأمامي
h=W_0 x+\tfrac{\alpha}{r}BAx
08 / 13
تعلم الآلة 101
و11 · د02
كفاءة LoRA

128× أقل في المعاملات

r=16
الرتبة · طبقة انتباه نموذجية
128×
أقل معاملات قابلة للتدريب

QLoRA يكمّم النموذج الأساسي إلى 4-بت NF4، ويتيح ضبط دقيق لنماذج 33B–70B على GPU استهلاكية بـ24 جيجابايت. ادمج المحوّلات للاستدلال بدون حمل إضافي.

09 / 13
تعلم الآلة 101
و11 · د02
أساليب PEFT

ما وراء LoRA

  • طبقات المحوّل — وحدات عنق زجاجة بين طبقات المحوّل؛ تضيف تأخيرًا للاستدلال
  • ضبط البادئة — رموز بادئة قابلة للتدريب تُحقن في متتاليتَي K وV للانتباه
  • ضبط السياق — تضمينات سياق ناعمة مستمرة؛ تنافسية عند الحجم الكبير
  • DoRA — يحلل الوزن إلى مقدار واتجاه؛ غالبًا يتجاوز LoRA
10 / 13
تعلم الآلة 101
و11 · د02
سير العمل العملي

قائمة تحقق الضبط الدقيق

  • اختر أصغر نموذج أساسي كافٍ للمهمة
  • نظّف مجموعة بياناتك ووازن فئاتها أولًا
  • استخراج ميزات → LoRA → ضبط دقيق كامل (صعِّد حسب الحاجة)
  • معدل التعلم: 1e-4 لمحوّلات LoRA، 1e-5–5e-5 للضبط الكامل
  • راقب خسارة التحقق؛ أوقف عند 1–5 حقبات
  • ادمج محوّلات LoRA قبل النشر
11 / 13
تعلم الآلة 101
التعلم بالنقل والضبط الدقيق

تحقّق ممّا انتقل

أربعة أسئلة عن الضبط الدقيق وLoRA والتعلم داخل السياق — استرجاع لا تعرّف.

السؤال 1 من 0
النتيجة 0/0

12 / 13
تعلم الآلة 101
النقاط الرئيسية
ملخص

النقاط الرئيسية

  • التعلم بالنقل يُعيد استخدام التمثيلات — بيانات وحوسبة أقل
  • استخراج الميزات: جمّد العمود، دُرِّب الرأس فقط — سريع وآمن للبيانات الصغيرة
  • الضبط الدقيق الكامل: معدل تعلم منخفض + إلغاء تجميد تدريجي لتجنب النسيان الكارثي
  • LoRA/QLoRA: تدريب تحديثات منخفضة الرتبة فقط — 128× أقل معاملات، GPU استهلاكية
  • التعلم الصفري/قليل الأمثلة: التعميم وقت الاستدلال بلا تحديث للأوزان
  • التدريب المسبق التكيفي يسد فجوات النطاق الكبيرة قبل الضبط الدقيق
13 / 13