الفكرة الأساسية: لا تبدأ من الصفر
تدريب شبكة عصبية عميقة من أوزان عشوائية على مجموعة بيانات صغيرة وصفةٌ مضمونة للإفراط في التخصيص. فالنموذج يمتلك ملايين المعاملات وبضعة آلاف من الأمثلة فحسب — فيحفظ بيانات التدريب بدلًا من تعلّم ميزات عامة. يحلّ التعلم بالنقل هذه المشكلة بإعادة استخدام الأوزان المكتسبة من مجموعة بيانات ضخمة وثيقة الصلة نقطةً للانطلاق نحو مهمة جديدة.
الحدسُ مقنع: شبكة التلافيف المدربة على 1.2 مليون صورة من ImageNet تعلّمت بالفعل اكتشاف الحواف والنسيج والأنماط وأجزاء الكائنات. والنموذج المدرب على مليارات الرموز المفردة رمّز قواعد النحو والحقائق وأنماط الاستدلال. هذه التمثيلات العامة تنتقل بشكل مدهش إلى مهام بعينها — التصوير الطبي، وتصنيف الوثائق القانونية، وتوليد الشيفرة — بأقل بكثير من البيانات والحسابات اللازمة للتدريب من الصفر.
تتعلم الطبقات الأولى في الشبكات العميقة ميزات منخفضة المستوى وعامة (حواف، ن-غرامات، صوتيات)؛ بينما تتعلم الطبقات اللاحقة تجريدات خاصة بالمهمة. عندما تتشابه النطاقان المصدري والهدفي في توزيع المدخلات، تكون ميزات الطبقات الأولى قابلة للإعادة المباشرة. ولا تحتاج سوى الرأس الخاص بالمهمة والطبقات الأخيرة إلى تكيّف جوهري.
مستودعات النماذج المدربة مسبقًا
تتوفر نماذج مفتوحة المصدر مدربة مسبقًا بكثرة عبر Hugging Face Hub وPyTorch Hub وTensorFlow Hub. أبرز العائلات:
استخراج الميزات: العمود الفقري المجمّد
أبسط استراتيجيات التعلم بالنقل هي استخراج الميزات: تجميد جميع الأوزان المدربة مسبقًا (ضبط requires_grad = False)، وإزالة رأس التصنيف الأصلي، وتدريب رأس جديد فوق التمثيلات الثابتة فقط. يعمل العمود المدرب مسبقًا كمستخرج ميزات ثابت؛ والمعاملات الوحيدة القابلة للتعلم هي في الرأس الجديد.
يُفضَّل استخراج الميزات عندما: (1) مجموعة البيانات المستهدفة صغيرة (مئات إلى بضعة آلاف مثال)، و(2) النطاق المستهدف قريب من نطاق التدريب المسبق، و(3) ميزانية الحسابات محدودة. يستغرق تدريب الرأس وقتًا قصيرًا — في كثير من الأحيان دقائق فقط على وحدة المعالجة المركزية. الخطر هو أن التمثيلات المجمّدة قد لا تكون مثالية للمهمة المستهدفة إذا اختلف النطاقان كثيرًا.
الضبط الدقيق: إلغاء التجميد والتدريب
يتجاوز الضبط الدقيق ذلك: بعد إضافة رأس جديد، تُلغى إجادة (أو معظم) الأوزان في النموذج المدرب مسبقًا وتُحدَّث مع الرأس الجديد باستخدام معدل تعلم منخفض. تُستخدم الأوزان المدربة مسبقًا كنقطة انطلاق لا كميزات ثابتة، مما يتيح تكيّفها مع المهمة المستهدفة.
استراتيجية معدل التعلم
رؤية أساسية: الطبقات الأولى تحتاج إلى تكيّف أقل من الطبقات اللاحقة، لأن الميزات الأولى أكثر عمومية. تعالج معدلات التعلم التفاضلية هذا بتعيين معدلات مختلفة لمجموعات طبقات مختلفة — أصغر للطبقات الأولى وأكبر للطبقات اللاحقة والرأس الجديد:
إلغاء التجميد التدريجي
بدلًا من إلغاء تجميد جميع الطبقات دفعة واحدة، يبدأ إلغاء التجميد التدريجي بتدريب الرأس الجديد وحده لبضع حقبات، ثم يُلغي تجميد مجموعات الطبقات الأقدم تباعًا. يحول هذا دون تدمير الأوزان المدربة مسبقًا في بداية التدريب حين ينتج الرأس العشوائي تدرجات كبيرة.
النسيان الكارثي
من أبرز نماذج الفشل النسيان الكارثي: الضبط الدقيق على مجموعة بيانات صغيرة بمعدل تعلم كبير قد يمحو التمثيلات العامة المكتسبة خلال التدريب المسبق، فينهار الأداء. من أبرز التخفيفات: استخدام معدل تعلم صغير (1e-5 إلى 1e-4)، وتطبيق الإيقاف المبكر، واستخدام Dropout، والإبقاء على عدد حقبات التدريب محدودًا.
| الاستراتيجية | المعاملات القابلة للتدريب | الأنسب عندما | الخطر |
|---|---|---|---|
| استخراج الميزات | الرأس فقط (~1%) | بيانات صغيرة، نطاق مشابه | دون المستوى إذا اختلف النطاق |
| الضبط الدقيق الكامل | الكل (100%) | بيانات متوسطة، أي نطاق | نسيان كارثي؛ مكلف |
| إلغاء تجميد تدريجي | يتصاعد مع الوقت | بيانات صغيرة إلى متوسطة | حلقة تدريب أكثر تعقيدًا |
| LoRA / PEFT | 0.1–2% | نماذج ضخمة، ذاكرة محدودة | أداء ذروة أقل قليلًا |
التكيف مع النطاق
يعالج التكيف مع النطاق الحالة التي يختلف فيها النطاق المستهدف اختلافًا جوهريًا عن نطاق التدريب المسبق — مثل استخدام نموذج مدرب على نصوص إنجليزية عامة للوثائق الطبية أو القانونية، أو استخدام نموذج ImageNet لصور الأقمار الاصطناعية. يعني الانزياح التوزيعي أن تمثيلات التدريب المسبق غير متوافقة مع المدخلات المستهدفة.
الاستمرار في التدريب المسبق
استراتيجية فعّالة هي الاستمرار في التدريب المسبق (المعروف بالتدريب المسبق التكيفي للنطاق، DAPT): تشغيل هدف التدريب المسبق (التنبؤ بالرموز المحجوبة لـBERT، أو النمذجة اللغوية السببية لـGPT) على مجموعة كبيرة من النصوص المتخصصة في النطاق قبل الضبط الدقيق على المهمة المستهدفة. يواءم هذا إحصاءات المفردات والتمثيلات السياقية مع النطاق المستهدف دون الحاجة إلى بيانات موسومة.
أمثلة: أُنشئ BioBERT وClinicalBERT باستمرار تدريب BERT المسبق على PubMed والملاحظات السريرية على التوالي، ثم ضبطهما الدقيق على مهام معالجة اللغة الطبيعية الطبية. تجاوز أداؤهما BERT العام بفارق واسع رغم استخدامهما أمثلة موسومة أقل.
التكيف غير الخاضع للإشراف
حين تغيب التصنيفات في النطاق المستهدف، تساعد تقنيات التكيف غير الخاضع للإشراف: المواءمة التعاكسية (تعلّم تمثيلات مستقلة عن النطاق بتضليل مُصنِّف النطاق)، أو التدريب الذاتي (وضع تصنيفات زائفة لأمثلة النطاق المستهدف بنموذج مدرب على المصدر ثم إعادة التدريب)، أو التكيف وقت الاختبار (تكييف إحصاءات Batch Normalization عند الاستدلال باستخدام عينات غير موسومة من النطاق المستهدف).
التعلم الصفري وقليل الأمثلة
تُبدي النماذج اللغوية الكبيرة الحديثة قدرات مدهشة في التعلم الصفري وقليل الأمثلة — إذ تؤدي مهامًا جديدة من مجرد وصف في السياق أو بضعة أمثلة فيه، دون أي تحديث للتدرجات. يختلف هذا جوهريًا عن الضبط الدقيق التقليدي: النموذج يعمم وقت الاستدلال لا وقت التدريب.
التعلم الصفري
يوفر نهج التعلم الصفري وصف المهمة فحسب (وأحيانًا تعليمات التنسيق) في السياق دون أمثلة. تستطيع نماذج كـGPT-4 وClaude وغيرها الإجابة على الأسئلة وترجمة النصوص وتصنيف المشاعر صفريًا لأن بيانات تدريبها المسبق تضمنت هذه المهام ضمنيًا. يعتمد الأداء اعتمادًا كبيرًا على جودة وصف المهمة (هندسة السياق).
التعلم بالتحديد عبر السياق
يوفر التعلم ذو الأمثلة القليلة عبر السياق (ICL) k أمثلة موسومة في السياق قبل المدخل الاختباري. يُكيِّف النموذج توليده بناءً على هذه العينات، متعلمًا فعليًا نمط المهمة من السياق. والأهم أنه لا تحدث أي تحديثات للتدرجات — الأوزان مجمّدة. يتسع أداء ICL مع حجم النموذج ويتأثر بانتقاء الأمثلة وترتيبها.
للنماذج الكبيرة المتاحة عبر API فقط، قد تكون هندسة السياق (التعلم الصفري/قليل الأمثلة) الخيار الوحيد. للنماذج المستضافة ذاتيًا مع بيانات كافية (>100–1000 مثال موسوم)، يتفوق الضبط الدقيق دائمًا تقريبًا على ICL في المهمة المستهدفة — على حساب حوسبة التدريب والذاكرة. يعتمد الاختيار على توفر البيانات وميزانية الحوسبة ومتطلبات زمن الاستجابة.
LoRA: التكيف منخفض الرتبة
الضبط الدقيق الكامل للنماذج اللغوية الكبيرة (7B–70B معامل) مكلف للغاية: تخزين حالات المحسِّن لـ7B معامل يستلزم ~100 جيجابايت من ذاكرة GPU. LoRA (التكيف منخفض الرتبة للنماذج اللغوية الكبيرة) هو أسلوب ضبط دقيق فعّال من حيث المعاملات يقلص هذه التكلفة بشكل كبير بتمثيل تحديثات الأوزان كتحليل منخفض الرتبة.
آلية عمل LoRA
لمصفوفة وزن مدربة مسبقًا W₀ ∈ ℝ^{d×k}، يجمّد LoRA W₀ ويضيف مسار تدريب منخفض الرتبة: مصفوفتان صغيرتان A ∈ ℝ^{d×r} وB ∈ ℝ^{r×k} حيث r ≪ min(d, k). خلال التمرير الأمامي، يكون الوزن الفعلي W₀ + BA. يُحدَّث A وB فقط أثناء التدريب؛ يظل W₀ مجمّدًا.
عدد المعاملات القابلة للتدريب هو r(d + k) بدلًا من dk. لمصفوفة انتباه نموذجية بـd = k = 4096 وr = 16، يستخدم LoRA 131K معامل بدلًا من 16.7M — انخفاض بعامل 128×. يُطبَّق LoRA عادةً على مصفوفات الإسقاط Q وV في كل طبقة انتباه، وإن كان يمكن تطبيقه على طبقات MLP أيضًا.
QLoRA: LoRA المكمِّم
يمتد QLoRA إلى LoRA بتكميم أوزان النموذج الأساسي المجمّد إلى 4-بت NF4، مما يقلص ذاكرة نموذج 7B من ~14 جيجابايت (BF16) إلى ~4 جيجابايت. تُدرَّب محوّلات LoRA بـBF16 فوق الأساس المكمَّم. يتيح هذا الضبط الدقيق لنماذج 33B–70B معامل على GPU استهلاكية واحدة (كـRTX 3090/4090 بـ24 جيجابايت VRAM) — إنجاز ديمقراطي في الضبط الدقيق للنماذج الكبيرة.
أساليب PEFT الأخرى
سير عمل الضبط الدقيق العملي
منهجية منظمة للضبط الدقيق لنموذج مدرب مسبقًا على مهمة جديدة:
- اختر النموذج الأساسي — اختر أصغر نموذج محتمل أن تكون طاقته كافية للمهمة. الأكبر لا يعني دائمًا الأفضل عند شُح البيانات.
- افحص مجموعة بياناتك ونظّفها — جودة البيانات أهم بكثير من كميتها في الضبط الدقيق. أزل التكرارات، وصحح ضجيج التصنيفات، ووازن الفئات إن لزم.
- حدد الاستراتيجية — استخراج الميزات للبيانات الصغيرة جدًا؛ LoRA للنماذج الكبيرة؛ الضبط الدقيق الكامل للنماذج المتوسطة مع بيانات كافية.
- اضبط معدل التعلم — ابدأ بـ1e-4 لمحوّلات LoRA، و1e-5 إلى 5e-5 للضبط الدقيق الكامل. استخدم جدول إحماء (5–10% من الخطوات) وتناقص جيبي التمام.
- راقب خسارة التحقق — يتقارب الضبط الدقيق عادةً في 1–5 حقبات. استخدم الإيقاف المبكر لتجنب الإفراط في التخصيص.
- قيِّم على مجموعة محجوزة — استخدم نفس مقاييس المهمة الأصلية. تحقق من تشوهات انزياح التوزيع.
- ادمج وانشر — لـLoRA، ادمج المحوّلات في أوزان النموذج الأساسي (
model.merge_and_unload()) للاستدلال دون حمل إضافي.
متى يفشل التعلم بالنقل؟
التعلم بالنقل ليس نافعًا دائمًا. قد يضر بالأداء عندما:
- نقل سلبي — النطاقان المصدري والمستهدف متباعدان للغاية
- تضارب المهمة — يُشجع هدف التدريب المسبق على تمثيلات تتعارض مع المهمة المستهدفة
- مجموعة بيانات مستهدفة ضخمة وعالية الجودة — مع ملايين الأمثلة الموسومة في النطاق المستهدف، قد يعادل التدريب من الصفر أو يتجاوز التعلم بالنقل
- عدم تطابق البنية — استخدام بنية نموذج غير مناسبة لطريقة المدخلات أو هيكل المهمة
شغّل دائمًا خطًا أساسيًا باستخراج الميزات قبل الالتزام بالضبط الدقيق الكامل المكلف، وقارن بنموذج بسيط داخل النطاق للتحقق من أن التعلم بالنقل يُفيد فعلًا.
يُعيد التعلم بالنقل استخدام التمثيلات من النماذج الكبيرة المدربة مسبقًا لتحقيق أداء قوي مع بيانات مستهدفة قليلة. يجمّد استخراج الميزات العمود الفقري ويدرب الرأس الجديد فقط — سريع وآمن للبيانات الصغيرة. الضبط الدقيق الكامل يكيّف جميع الأوزان بمعدل تعلم منخفض — أكثر قوة لكنه معرّض للنسيان الكارثي. يتيح LoRA وQLoRA الضبط الدقيق الفعّال في المعاملات لنماذج LLM على أجهزة المستهلك بتدريب تحديثات منخفضة الرتبة فقط. يُعمِّم التعلم الصفري وقليل الأمثلة عبر السياق وقت الاستدلال دون تحديث أي أوزان. يسد التدريب المسبق التكيفي فجوات النطاق الكبيرة. اختر أبسط استراتيجية تُجدي.