الرئيسية / تعلم الآلة 101 / الوحدة 11 / الدرس 2

التعلم بالنقل والضبط الدقيق

مستودعات النماذج المدربة مسبقًا، واستخراج الميزات، واستراتيجيات الضبط الدقيق، والتكيف مع النطاق، والتعلم من أمثلة قليلة، وLoRA — إعادة استخدام المعرفة بدلًا من البدء من الصفر.

~18 دقيقة قراءة و11 · د2 متقدم

الفكرة الأساسية: لا تبدأ من الصفر

تدريب شبكة عصبية عميقة من أوزان عشوائية على مجموعة بيانات صغيرة وصفةٌ مضمونة للإفراط في التخصيص. فالنموذج يمتلك ملايين المعاملات وبضعة آلاف من الأمثلة فحسب — فيحفظ بيانات التدريب بدلًا من تعلّم ميزات عامة. يحلّ التعلم بالنقل هذه المشكلة بإعادة استخدام الأوزان المكتسبة من مجموعة بيانات ضخمة وثيقة الصلة نقطةً للانطلاق نحو مهمة جديدة.

الحدسُ مقنع: شبكة التلافيف المدربة على 1.2 مليون صورة من ImageNet تعلّمت بالفعل اكتشاف الحواف والنسيج والأنماط وأجزاء الكائنات. والنموذج المدرب على مليارات الرموز المفردة رمّز قواعد النحو والحقائق وأنماط الاستدلال. هذه التمثيلات العامة تنتقل بشكل مدهش إلى مهام بعينها — التصوير الطبي، وتصنيف الوثائق القانونية، وتوليد الشيفرة — بأقل بكثير من البيانات والحسابات اللازمة للتدريب من الصفر.

لماذا ينجح النقل؟

تتعلم الطبقات الأولى في الشبكات العميقة ميزات منخفضة المستوى وعامة (حواف، ن-غرامات، صوتيات)؛ بينما تتعلم الطبقات اللاحقة تجريدات خاصة بالمهمة. عندما تتشابه النطاقان المصدري والهدفي في توزيع المدخلات، تكون ميزات الطبقات الأولى قابلة للإعادة المباشرة. ولا تحتاج سوى الرأس الخاص بالمهمة والطبقات الأخيرة إلى تكيّف جوهري.

مستودعات النماذج المدربة مسبقًا

تتوفر نماذج مفتوحة المصدر مدربة مسبقًا بكثرة عبر Hugging Face Hub وPyTorch Hub وTensorFlow Hub. أبرز العائلات:

رؤية (CNN)
مدرب على ImageNet
ResNet وEfficientNet وConvNeXt. مدربة على ImageNet-1K أو 21K. الأساس الأمثل لتصنيف الصور واستخراج الميزات.
رؤية (ViT)
محوّل قائم على الرقع
ViT وDeiT وCLIP. يتسع أفضل من CNNs؛ يتيح CLIP التصنيف الصفري للصور عبر مواءمة النص والصورة.
لغة (ترميز)
نمط BERT
BERT وRoBERTa وDeBERTa. مدربة بالتنبؤ بالرموز المحجوبة. ممتاز للتصنيف والتعرف على الكيانات.
لغة (فك ترميز)
نمط GPT
GPT-2 وLLaMA وMistral. مدربة بالتنبؤ السببي. ممتاز للتوليد والتلخيص واتباع التعليمات.
ترميز-فك ترميز
Seq2Seq
T5 وBART وmBART. مدربة على مهام نص إلى نص. متفوقة في الترجمة والتلخيص.
متعدد الوسائط
صورة + نص
CLIP وBLIP-2 وLLaVA. تمثيلات رؤية-لغة مشتركة. تتيح الإجابة على أسئلة بصرية وتعليق الصور.

استخراج الميزات: العمود الفقري المجمّد

أبسط استراتيجيات التعلم بالنقل هي استخراج الميزات: تجميد جميع الأوزان المدربة مسبقًا (ضبط requires_grad = False)، وإزالة رأس التصنيف الأصلي، وتدريب رأس جديد فوق التمثيلات الثابتة فقط. يعمل العمود المدرب مسبقًا كمستخرج ميزات ثابت؛ والمعاملات الوحيدة القابلة للتعلم هي في الرأس الجديد.

استخراج الميزات
\hat{y} = W \cdot f_{\text{frozen}}(x)
f(·) هو العمود الفقري المجمّد المدرب مسبقًا؛ W هو الرأس الجديد القابل للتدريب. لا يُحدَّث سوى W أثناء التدريب — مما يقلل عدد المعاملات القابلة للتعلم بشكل كبير.

يُفضَّل استخراج الميزات عندما: (1) مجموعة البيانات المستهدفة صغيرة (مئات إلى بضعة آلاف مثال)، و(2) النطاق المستهدف قريب من نطاق التدريب المسبق، و(3) ميزانية الحسابات محدودة. يستغرق تدريب الرأس وقتًا قصيرًا — في كثير من الأحيان دقائق فقط على وحدة المعالجة المركزية. الخطر هو أن التمثيلات المجمّدة قد لا تكون مثالية للمهمة المستهدفة إذا اختلف النطاقان كثيرًا.

الضبط الدقيق: إلغاء التجميد والتدريب

يتجاوز الضبط الدقيق ذلك: بعد إضافة رأس جديد، تُلغى إجادة (أو معظم) الأوزان في النموذج المدرب مسبقًا وتُحدَّث مع الرأس الجديد باستخدام معدل تعلم منخفض. تُستخدم الأوزان المدربة مسبقًا كنقطة انطلاق لا كميزات ثابتة، مما يتيح تكيّفها مع المهمة المستهدفة.

استراتيجية معدل التعلم

رؤية أساسية: الطبقات الأولى تحتاج إلى تكيّف أقل من الطبقات اللاحقة، لأن الميزات الأولى أكثر عمومية. تعالج معدلات التعلم التفاضلية هذا بتعيين معدلات مختلفة لمجموعات طبقات مختلفة — أصغر للطبقات الأولى وأكبر للطبقات اللاحقة والرأس الجديد:

معدل التعلم التفاضلي
\eta_{L_1} < \eta_{L_2} < \cdots < \eta_{L_k}
تحصل مجموعات الطبقات L1 (الأولى) حتى Lk (الرأس الجديد) على معدلات تعلم متصاعدة تدريجيًا. العامل الشائع هو 2–10× بين المجموعات المتجاورة.

إلغاء التجميد التدريجي

بدلًا من إلغاء تجميد جميع الطبقات دفعة واحدة، يبدأ إلغاء التجميد التدريجي بتدريب الرأس الجديد وحده لبضع حقبات، ثم يُلغي تجميد مجموعات الطبقات الأقدم تباعًا. يحول هذا دون تدمير الأوزان المدربة مسبقًا في بداية التدريب حين ينتج الرأس العشوائي تدرجات كبيرة.

النسيان الكارثي

من أبرز نماذج الفشل النسيان الكارثي: الضبط الدقيق على مجموعة بيانات صغيرة بمعدل تعلم كبير قد يمحو التمثيلات العامة المكتسبة خلال التدريب المسبق، فينهار الأداء. من أبرز التخفيفات: استخدام معدل تعلم صغير (1e-5 إلى 1e-4)، وتطبيق الإيقاف المبكر، واستخدام Dropout، والإبقاء على عدد حقبات التدريب محدودًا.

الاستراتيجيةالمعاملات القابلة للتدريبالأنسب عندماالخطر
استخراج الميزاتالرأس فقط (~1%)بيانات صغيرة، نطاق مشابهدون المستوى إذا اختلف النطاق
الضبط الدقيق الكاملالكل (100%)بيانات متوسطة، أي نطاقنسيان كارثي؛ مكلف
إلغاء تجميد تدريجييتصاعد مع الوقتبيانات صغيرة إلى متوسطةحلقة تدريب أكثر تعقيدًا
LoRA / PEFT0.1–2%نماذج ضخمة، ذاكرة محدودةأداء ذروة أقل قليلًا

التكيف مع النطاق

يعالج التكيف مع النطاق الحالة التي يختلف فيها النطاق المستهدف اختلافًا جوهريًا عن نطاق التدريب المسبق — مثل استخدام نموذج مدرب على نصوص إنجليزية عامة للوثائق الطبية أو القانونية، أو استخدام نموذج ImageNet لصور الأقمار الاصطناعية. يعني الانزياح التوزيعي أن تمثيلات التدريب المسبق غير متوافقة مع المدخلات المستهدفة.

الاستمرار في التدريب المسبق

استراتيجية فعّالة هي الاستمرار في التدريب المسبق (المعروف بالتدريب المسبق التكيفي للنطاق، DAPT): تشغيل هدف التدريب المسبق (التنبؤ بالرموز المحجوبة لـBERT، أو النمذجة اللغوية السببية لـGPT) على مجموعة كبيرة من النصوص المتخصصة في النطاق قبل الضبط الدقيق على المهمة المستهدفة. يواءم هذا إحصاءات المفردات والتمثيلات السياقية مع النطاق المستهدف دون الحاجة إلى بيانات موسومة.

أمثلة: أُنشئ BioBERT وClinicalBERT باستمرار تدريب BERT المسبق على PubMed والملاحظات السريرية على التوالي، ثم ضبطهما الدقيق على مهام معالجة اللغة الطبيعية الطبية. تجاوز أداؤهما BERT العام بفارق واسع رغم استخدامهما أمثلة موسومة أقل.

التكيف غير الخاضع للإشراف

حين تغيب التصنيفات في النطاق المستهدف، تساعد تقنيات التكيف غير الخاضع للإشراف: المواءمة التعاكسية (تعلّم تمثيلات مستقلة عن النطاق بتضليل مُصنِّف النطاق)، أو التدريب الذاتي (وضع تصنيفات زائفة لأمثلة النطاق المستهدف بنموذج مدرب على المصدر ثم إعادة التدريب)، أو التكيف وقت الاختبار (تكييف إحصاءات Batch Normalization عند الاستدلال باستخدام عينات غير موسومة من النطاق المستهدف).

التعلم الصفري وقليل الأمثلة

تُبدي النماذج اللغوية الكبيرة الحديثة قدرات مدهشة في التعلم الصفري وقليل الأمثلة — إذ تؤدي مهامًا جديدة من مجرد وصف في السياق أو بضعة أمثلة فيه، دون أي تحديث للتدرجات. يختلف هذا جوهريًا عن الضبط الدقيق التقليدي: النموذج يعمم وقت الاستدلال لا وقت التدريب.

التعلم الصفري

يوفر نهج التعلم الصفري وصف المهمة فحسب (وأحيانًا تعليمات التنسيق) في السياق دون أمثلة. تستطيع نماذج كـGPT-4 وClaude وغيرها الإجابة على الأسئلة وترجمة النصوص وتصنيف المشاعر صفريًا لأن بيانات تدريبها المسبق تضمنت هذه المهام ضمنيًا. يعتمد الأداء اعتمادًا كبيرًا على جودة وصف المهمة (هندسة السياق).

التعلم بالتحديد عبر السياق

يوفر التعلم ذو الأمثلة القليلة عبر السياق (ICL) k أمثلة موسومة في السياق قبل المدخل الاختباري. يُكيِّف النموذج توليده بناءً على هذه العينات، متعلمًا فعليًا نمط المهمة من السياق. والأهم أنه لا تحدث أي تحديثات للتدرجات — الأوزان مجمّدة. يتسع أداء ICL مع حجم النموذج ويتأثر بانتقاء الأمثلة وترتيبها.

هندسة السياق مقابل الضبط الدقيق

للنماذج الكبيرة المتاحة عبر API فقط، قد تكون هندسة السياق (التعلم الصفري/قليل الأمثلة) الخيار الوحيد. للنماذج المستضافة ذاتيًا مع بيانات كافية (>100–1000 مثال موسوم)، يتفوق الضبط الدقيق دائمًا تقريبًا على ICL في المهمة المستهدفة — على حساب حوسبة التدريب والذاكرة. يعتمد الاختيار على توفر البيانات وميزانية الحوسبة ومتطلبات زمن الاستجابة.

LoRA: التكيف منخفض الرتبة

الضبط الدقيق الكامل للنماذج اللغوية الكبيرة (7B–70B معامل) مكلف للغاية: تخزين حالات المحسِّن لـ7B معامل يستلزم ~100 جيجابايت من ذاكرة GPU. LoRA (التكيف منخفض الرتبة للنماذج اللغوية الكبيرة) هو أسلوب ضبط دقيق فعّال من حيث المعاملات يقلص هذه التكلفة بشكل كبير بتمثيل تحديثات الأوزان كتحليل منخفض الرتبة.

آلية عمل LoRA

لمصفوفة وزن مدربة مسبقًا W₀ ∈ ℝ^{d×k}، يجمّد LoRA W₀ ويضيف مسار تدريب منخفض الرتبة: مصفوفتان صغيرتان A ∈ ℝ^{d×r} وB ∈ ℝ^{r×k} حيث r ≪ min(d, k). خلال التمرير الأمامي، يكون الوزن الفعلي W₀ + BA. يُحدَّث A وB فقط أثناء التدريب؛ يظل W₀ مجمّدًا.

تحديث LoRA
h = W_0 x + \frac{\alpha}{r} B A x
W₀ مجمّد؛ يُهيَّأ A بضجيج غاوسي وB بالأصفار (بحيث ΔW = BA = 0 عند التهيئة). α معامل ضبط التحجيم؛ r هي الرتبة (عادةً 4–64).

عدد المعاملات القابلة للتدريب هو r(d + k) بدلًا من dk. لمصفوفة انتباه نموذجية بـd = k = 4096 وr = 16، يستخدم LoRA 131K معامل بدلًا من 16.7M — انخفاض بعامل 128×. يُطبَّق LoRA عادةً على مصفوفات الإسقاط Q وV في كل طبقة انتباه، وإن كان يمكن تطبيقه على طبقات MLP أيضًا.

QLoRA: LoRA المكمِّم

يمتد QLoRA إلى LoRA بتكميم أوزان النموذج الأساسي المجمّد إلى 4-بت NF4، مما يقلص ذاكرة نموذج 7B من ~14 جيجابايت (BF16) إلى ~4 جيجابايت. تُدرَّب محوّلات LoRA بـBF16 فوق الأساس المكمَّم. يتيح هذا الضبط الدقيق لنماذج 33B–70B معامل على GPU استهلاكية واحدة (كـRTX 3090/4090 بـ24 جيجابايت VRAM) — إنجاز ديمقراطي في الضبط الدقيق للنماذج الكبيرة.

أساليب PEFT الأخرى

طبقات المحوّل
وحدات عنق الزجاجة
وحدات صغيرة تُدرج بين طبقات المحوّل (إسقاط أسفل ← لاخطية ← إسقاط أعلى). المحوّلات وحدها تُدرَّب. يضيف تأخيرًا وقت الاستدلال.
ضبط البادئة
رموز بادئة قابلة للتدريب
إضافة رموز "بادئة" قابلة للتدريب إلى متتاليتَي K وV في كل طبقة انتباه. لا تغيير في الأوزان؛ يُحقن السياق عبر الانتباه.
ضبط السياق
رموز سياق ناعمة
تعلّم مجموعة صغيرة من تضمينات سياق مستمرة (ناعمة) تُضاف إلى بداية المدخل. أبسط من ضبط البادئة؛ تنافسية على نطاق واسع (11B+).
DoRA
LoRA المحلَّل
يحلل الوزن إلى مقدار واتجاه؛ يضبطهما بشكل منفصل. غالبًا يتجاوز LoRA بعدد معاملات مماثل.

سير عمل الضبط الدقيق العملي

منهجية منظمة للضبط الدقيق لنموذج مدرب مسبقًا على مهمة جديدة:

  1. اختر النموذج الأساسي — اختر أصغر نموذج محتمل أن تكون طاقته كافية للمهمة. الأكبر لا يعني دائمًا الأفضل عند شُح البيانات.
  2. افحص مجموعة بياناتك ونظّفها — جودة البيانات أهم بكثير من كميتها في الضبط الدقيق. أزل التكرارات، وصحح ضجيج التصنيفات، ووازن الفئات إن لزم.
  3. حدد الاستراتيجية — استخراج الميزات للبيانات الصغيرة جدًا؛ LoRA للنماذج الكبيرة؛ الضبط الدقيق الكامل للنماذج المتوسطة مع بيانات كافية.
  4. اضبط معدل التعلم — ابدأ بـ1e-4 لمحوّلات LoRA، و1e-5 إلى 5e-5 للضبط الدقيق الكامل. استخدم جدول إحماء (5–10% من الخطوات) وتناقص جيبي التمام.
  5. راقب خسارة التحقق — يتقارب الضبط الدقيق عادةً في 1–5 حقبات. استخدم الإيقاف المبكر لتجنب الإفراط في التخصيص.
  6. قيِّم على مجموعة محجوزة — استخدم نفس مقاييس المهمة الأصلية. تحقق من تشوهات انزياح التوزيع.
  7. ادمج وانشر — لـLoRA، ادمج المحوّلات في أوزان النموذج الأساسي (model.merge_and_unload()) للاستدلال دون حمل إضافي.

متى يفشل التعلم بالنقل؟

التعلم بالنقل ليس نافعًا دائمًا. قد يضر بالأداء عندما:

شغّل دائمًا خطًا أساسيًا باستخراج الميزات قبل الالتزام بالضبط الدقيق الكامل المكلف، وقارن بنموذج بسيط داخل النطاق للتحقق من أن التعلم بالنقل يُفيد فعلًا.


النقاط الرئيسية

يُعيد التعلم بالنقل استخدام التمثيلات من النماذج الكبيرة المدربة مسبقًا لتحقيق أداء قوي مع بيانات مستهدفة قليلة. يجمّد استخراج الميزات العمود الفقري ويدرب الرأس الجديد فقط — سريع وآمن للبيانات الصغيرة. الضبط الدقيق الكامل يكيّف جميع الأوزان بمعدل تعلم منخفض — أكثر قوة لكنه معرّض للنسيان الكارثي. يتيح LoRA وQLoRA الضبط الدقيق الفعّال في المعاملات لنماذج LLM على أجهزة المستهلك بتدريب تحديثات منخفضة الرتبة فقط. يُعمِّم التعلم الصفري وقليل الأمثلة عبر السياق وقت الاستدلال دون تحديث أي أوزان. يسد التدريب المسبق التكيفي فجوات النطاق الكبيرة. اختر أبسط استراتيجية تُجدي.

السابق و11-د1: التدريب على نطاق واسع نظرة عامة على الوحدة الدرس التالي و11-د3: النماذج التوليدية