الرئيسية / LA 101 / الوحدة 11 / الدرس 1
وضع القصص

النماذج الخطية

من الانحدار الخطي إلى آلات المتجهات الداعمة، أقوى الأفكار في تعلم الآلة هي تعبيرات عن الجبر الخطي. فهم البنية المصفوفية وراء هذه النماذج يفتح الحدس والحساب الفعّال.

~14 دقيقة قراءة الوحدة 11 · الدرس 1 متوسط

منظور المصفوفات في تعلم الآلة

تستوعب نماذج تعلم الآلة البيانات — آلاف أو ملايين الأمثلة، كل منها يُوصف بعدة ميزات. الخطوة الأولى في تقريباً كل خوارزمية هي تنظيم هذه البيانات في مصفوفة التصميم X، حيث يمثل كل صف مثالاً واحداً وكل عمود ميزةً واحدة. عندما يكون النموذج خطياً، تتحوّل مهمة التنبؤ بأكملها إلى سلسلة من عمليات المصفوفات.

هذا ليس مجرد اصطلاح رياضي ملائم. البنية المصفوفية تكشف أي العمليات قابلة للتوازي، أي الحلول دقيقة، كيف تبدو هندسة المسألة، ولماذا تعمل استراتيجيات التنظيم المعينة. كل معادلة نشتقها في هذا الدرس لها تفسير هندسي أنيق في فضاء الأعمدة لـ X.

الانحدار الخطي: المعادلات الاعتيادية

بناءً على n مثالاً تدريبياً لكل منها p ميزة، يُمثّل الانحدار الخطي المخرج كتركيب خطي للميزات:

نموذج الانحدار الخطي
\mathbf{y} = X\boldsymbol{\beta} + \boldsymbol{\varepsilon}
X هي مصفوفة التصميم بأبعاد n×p، و β هو متجه المعاملات ذو p بُعداً، و ε هو متجه الضوضاء ذو n بُعداً. كل صف xᵢᵀβ يعطي القيمة المتنبأ بها للمثال i. الهدف إيجاد β الذي يصغّر مجموع مربعات البواقي.

نريد تصغير مجموع مربعات البواقي: RSS(β) = ‖y − Xβ‖². هذه هي المسافة التربيعية من متجه الاستجابة y إلى المتجه Xβ في ℝⁿ. هندسياً، المُصغِّر هو الإسقاط الإسقاط العمودي لـ y على فضاء الأعمدة لـ X — أقرب نقطة في col(X) إلى y.

ضبط التدرج على الصفر يعطي المعادلات الاعتيادية: XᵀXβ = Xᵀy. عندما تكون XᵀX قابلة للعكس، الحل الوحيد للمربعات الصغرى هو:

حل المربعات الصغرى الاعتيادية
\hat{\boldsymbol{\beta}} = (X^T X)^{-1} X^T \mathbf{y}
مصفوفة القبعة H = X(XᵀX)⁻¹Xᵀ هي الإسقاط العمودي على col(X). القيم المُناسِبة ŷ = Hy هي إسقاط y على فضاء أعمدة X. عندما لا تكون الأعمدة مستقلة خطياً، يحل الشبه العكسي لـ Moore-Penrose محل (XᵀX)⁻¹Xᵀ.
التفسير الهندسي

الانحدار الخطي هو إسقاط عمودي. متجه البواقي r = y − ŷ عمودي على كل عمود من أعمدة X — أي Xᵀr = 0. هذه هي المعادلات الاعتيادية معاد ترتيبها. المتجه المُسقَط ŷ هو النقطة الوحيدة في col(X) الأقرب إلى y.

انحدار ريدج: التنظيم L2

عندما يكون p كبيراً بالنسبة لـ n، أو عندما تكون أعمدة X شبه متعامدة خطياً، تصبح المصفوفة XᵀX سيئة التهيئة: التغيرات الصغيرة في y تسبب تأرجحاً كبيراً في تقدير OLS. يستقر انحدار ريدج الحل بإضافة عقوبة على حجم β:

هدف ريدج وحله
\hat{\boldsymbol{\beta}}_{\text{ridge}} = (X^T X + \lambda I)^{-1} X^T \mathbf{y}
يضيف حل ريدج λI إلى XᵀX ربما الشاذة، مما يضمن إمكانية العكس لأي λ > 0. القيمة الأكبر لـ λ تُقلّص جميع المعاملات نحو الصفر. المصفوفة (XᵀX + λI) لها نفس المتجهات الذاتية لـ XᵀX لكن قيمها الذاتية تُزاد بـ λ — مما يُحسّن رقم التكييف مباشرةً.

التحليل SVD لـ X = UΣVᵀ يجعل هندسة انحدار ريدج شفافة. حل OLS يتوسع كـ β̂ = Σₖ (uₖᵀy / σₖ) vₖ — مساهمات الاتجاهات ذات القيم الأحادية الصغيرة σₖ تتضخم إذا كانت σₖ ضئيلة. ريدج يستبدل σₖ بـ σₖ²/(σₖ² + λ)، مُقلِّصاً كل مكوّن بسلاسة بدلاً من اقتطاعه.

انحدار لاسو: التنظيم L1

يستبدل لاسو (Least Absolute Shrinkage and Selection Operator) عقوبة L2 بعقوبة L1 على المعاملات. وهنا معياران يعملان معاً، فلنسمّهما جنباً إلى جنب: المعيار L2 (الإقليدي) ‖β‖₂ = √(Σⱼ βⱼ²) هو طول الخط المستقيم الذي تعرفه من الوحدة 6، أما المعيار L1 (معيار سيارة الأجرة) ‖β‖₁ = Σⱼ |βⱼ| فيجمع القيم المطلقة ببساطة. كلاهما يقيس "حجم" متجه المعاملات، لكنهما يعاقبان بطريقتين مختلفتين — وهذا الاختلاف بالضبط هو ما يجعل حلول لاسو ضئيلة.

هدف لاسو
\hat{\boldsymbol{\beta}}_{\text{lasso}} = \underset{\boldsymbol{\beta}}{\arg\min}\; \|\mathbf{y} - X\boldsymbol{\beta}\|^2 + \lambda \|\boldsymbol{\beta}\|_1
القيد L1 هو ‖β‖₁ = Σⱼ|βⱼ|، الذي يُنشئ منطقة جدوى على شكل ماسة في فضاء المعاملات. لأن أركان الماسة تقع على المحاور الإحداثية، يقع الحل الأمثل في أغلب الأحيان عند ركن — يضع بعض المعاملات إلى الصفر بالضبط. لاسو يُجري اختيار المتغيرات تلقائياً.

على عكس انحدار ريدج، لا يملك لاسو حلاً مغلق الصيغة لأن المعيار L1 غير قابل للاشتقاق عند الصفر. يُحل بخوارزميات الأمثلة المحدبة كالنزول بالإحداثيات أو خوارزمية LARS. الأثر البنيوي الرئيسي هندسي: كرة L1 هي متعدد الوجوه (ماسة في بُعدَين، cross-polytope في أبعاد أعلى) ونقاطها المتطرفة تقع على المحاور الإحداثية، مما يُعزز الضآلة.

ريدج مقابل لاسو: مقارنة

حيلة النواة

تفترض نماذج الانحدار والتصنيف الخطية أن حدود القرار أو دالة الانحدار خطية في الميزات. عندما يكون هذا مُقيِّداً جداً، أحد الأساليب هو تعيين البيانات إلى فضاء ميزات أعلى بُعداً حيث تعمل النماذج الخطية بشكل أفضل. حيلة النواة تتجنب حساب هذا التعيين عالي الأبعاد بشكل صريح.

لنفترض أننا نعيّن كل نقطة بيانات xᵢ إلى متجه ميزات φ(xᵢ) في فضاء ما (ربما لا نهائي الأبعاد). دالة النواة k(xᵢ, xⱼ) = φ(xᵢ)ᵀφ(xⱼ) تحسب الضرب الداخلي في هذا الفضاء من المدخلات الأصلية — دون حساب φ بشكل صريح. النوى الشائعة تشمل:

مصفوفة النواة K (حيث Kᵢⱼ = k(xᵢ, xⱼ)) تحل محل XᵀX أو XXᵀ في المعادلات الاعتيادية. أي خوارزمية تصل إلى البيانات فقط من خلال الضربات الداخلية يمكن "نوّاتها" — بما يشمل الانحدار، PCA، وآلات المتجهات الداعمة.

مبرهنة ميرسر

الدالة k(x, z) هي نواة صحيحة إذا وفقط إذا كانت مصفوفة النواة n×n هي K متماثلة موجبة شبه محددة لأي اختيار لـ n نقطة بيانات. هذا يضمن وجود تعيين ميزات φ ويضمن أن خوارزميات النواة تقابل مسائل أمثلة محدبة.

آلات المتجهات الداعمة: منظور الجبر الخطي

تجد آلة المتجهات الداعمة (SVM) المستوى الفاصل ذا الهامش الأقصى الذي يفصل فئتين. في الحالة القابلة للفصل خطياً، المستوى الفاصل يُعرَّف بمتجه الأوزان w والإزاحة b بحيث wᵀxᵢ + b ≥ 1 للفئة +1 و wᵀxᵢ + b ≤ −1 للفئة −1. عرض الهامش هو 2/‖w‖، لذا تعظيم الهامش يُعادل تصغير ‖w‖²/2:

SVM ذات الهامش الصلب
\min_{\mathbf{w},b}\; \tfrac{1}{2}\|\mathbf{w}\|^2 \quad \text{s.t.} \quad y_i(\mathbf{w}^T \mathbf{x}_i + b) \geq 1 \; \forall i
هذا برنامج تربيعي (QP): تصغير هدف تربيعي ضمن قيود عدم مساواة خطية. الصياغة الثنائية تُظهر أن الحل يعتمد فقط على الضربات الداخلية xᵢᵀxⱼ، مما يُمكّن النوّاتة. المتجهات الداعمة هي نقاط التدريب التي تحقق αᵢ > 0 في الثنائية — النقاط الأقرب إلى حد القرار.

الثنائية Lagrangian لـ SVM-QP هي: تعظيم Σᵢ αᵢ − ½ Σᵢⱼ αᵢ αⱼ yᵢ yⱼ (xᵢᵀxⱼ)، ضمن αᵢ ≥ 0 و Σᵢ αᵢ yᵢ = 0. بما أن البيانات تظهر فقط من خلال الضربات الداخلية xᵢᵀxⱼ، استبدال هذه بنواة k(xᵢ, xⱼ) يعطي SVM بالنواة — مصنّف خطي في فضاء الميزات φ(x)، الذي قد يكون غير خطي في فضاء المدخلات الأصلي.

SVM ذات الهامش اللين

البيانات الحقيقية نادراً ما تكون قابلة للفصل خطياً. تُدخل SVM ذات الهامش اللين متغيرات فضفاضة ξᵢ ≥ 0 تسمح لبعض نقاط التدريب بانتهاك الهامش، بتكلفة تُعاقب عليها المعامل C. يصبح الهدف min ½‖w‖² + C Σᵢ ξᵢ — مفاضلة كلاسيكية بين التحيز والتباين: C الكبير يعني انخفاض خطأ التدريب (تحيز منخفض، تباين مرتفع)؛ C الصغير يسمح بانتهاكات هامشية أكثر (تحيز مرتفع، تباين منخفض).


النقاط الرئيسية

الانحدار الخطي هو إسقاط عمودي على فضاء أعمدة مصفوفة التصميم X، بالحل المغلق β̂ = (XᵀX)⁻¹Xᵀy. انحدار ريدج يضيف λI لتثبيت الحل، مع تقليص كل مكوّن SVD بـ σ²/(σ²+λ). لاسو يستخدم عقوبة L1 التي تُنتج تلقائياً حلولاً ضئيلة — اختيار تلقائي للميزات. حيلة النواة تستبدل التعيينات الصريحة عالية الأبعاد بدوال النواة k(xᵢ,xⱼ)، مُمكِّنةً نماذج غير خطية تتحول إلى جبر خطي على مصفوفة النواة. تجد SVMs المستوى الفاصل ذا الهامش الأقصى عبر برنامج تربيعي تعتمد صياغته الثنائية فقط على الضربات الداخلية — مما يجعلها قابلة للنوّاتة بشكل طبيعي.