منظور المصفوفات في تعلم الآلة
تستوعب نماذج تعلم الآلة البيانات — آلاف أو ملايين الأمثلة، كل منها يُوصف بعدة ميزات. الخطوة الأولى في تقريباً كل خوارزمية هي تنظيم هذه البيانات في مصفوفة التصميم X، حيث يمثل كل صف مثالاً واحداً وكل عمود ميزةً واحدة. عندما يكون النموذج خطياً، تتحوّل مهمة التنبؤ بأكملها إلى سلسلة من عمليات المصفوفات.
هذا ليس مجرد اصطلاح رياضي ملائم. البنية المصفوفية تكشف أي العمليات قابلة للتوازي، أي الحلول دقيقة، كيف تبدو هندسة المسألة، ولماذا تعمل استراتيجيات التنظيم المعينة. كل معادلة نشتقها في هذا الدرس لها تفسير هندسي أنيق في فضاء الأعمدة لـ X.
الانحدار الخطي: المعادلات الاعتيادية
بناءً على n مثالاً تدريبياً لكل منها p ميزة، يُمثّل الانحدار الخطي المخرج كتركيب خطي للميزات:
نريد تصغير مجموع مربعات البواقي: RSS(β) = ‖y − Xβ‖². هذه هي المسافة التربيعية من متجه الاستجابة y إلى المتجه Xβ في ℝⁿ. هندسياً، المُصغِّر هو الإسقاط الإسقاط العمودي لـ y على فضاء الأعمدة لـ X — أقرب نقطة في col(X) إلى y.
ضبط التدرج على الصفر يعطي المعادلات الاعتيادية: XᵀXβ = Xᵀy. عندما تكون XᵀX قابلة للعكس، الحل الوحيد للمربعات الصغرى هو:
الانحدار الخطي هو إسقاط عمودي. متجه البواقي r = y − ŷ عمودي على كل عمود من أعمدة X — أي Xᵀr = 0. هذه هي المعادلات الاعتيادية معاد ترتيبها. المتجه المُسقَط ŷ هو النقطة الوحيدة في col(X) الأقرب إلى y.
انحدار ريدج: التنظيم L2
عندما يكون p كبيراً بالنسبة لـ n، أو عندما تكون أعمدة X شبه متعامدة خطياً، تصبح المصفوفة XᵀX سيئة التهيئة: التغيرات الصغيرة في y تسبب تأرجحاً كبيراً في تقدير OLS. يستقر انحدار ريدج الحل بإضافة عقوبة على حجم β:
التحليل SVD لـ X = UΣVᵀ يجعل هندسة انحدار ريدج شفافة. حل OLS يتوسع كـ β̂ = Σₖ (uₖᵀy / σₖ) vₖ — مساهمات الاتجاهات ذات القيم الأحادية الصغيرة σₖ تتضخم إذا كانت σₖ ضئيلة. ريدج يستبدل σₖ بـ σₖ²/(σₖ² + λ)، مُقلِّصاً كل مكوّن بسلاسة بدلاً من اقتطاعه.
انحدار لاسو: التنظيم L1
يستبدل لاسو (Least Absolute Shrinkage and Selection Operator) عقوبة L2 بعقوبة L1 على المعاملات. وهنا معياران يعملان معاً، فلنسمّهما جنباً إلى جنب: المعيار L2 (الإقليدي) ‖β‖₂ = √(Σⱼ βⱼ²) هو طول الخط المستقيم الذي تعرفه من الوحدة 6، أما المعيار L1 (معيار سيارة الأجرة) ‖β‖₁ = Σⱼ |βⱼ| فيجمع القيم المطلقة ببساطة. كلاهما يقيس "حجم" متجه المعاملات، لكنهما يعاقبان بطريقتين مختلفتين — وهذا الاختلاف بالضبط هو ما يجعل حلول لاسو ضئيلة.
على عكس انحدار ريدج، لا يملك لاسو حلاً مغلق الصيغة لأن المعيار L1 غير قابل للاشتقاق عند الصفر. يُحل بخوارزميات الأمثلة المحدبة كالنزول بالإحداثيات أو خوارزمية LARS. الأثر البنيوي الرئيسي هندسي: كرة L1 هي متعدد الوجوه (ماسة في بُعدَين، cross-polytope في أبعاد أعلى) ونقاطها المتطرفة تقع على المحاور الإحداثية، مما يُعزز الضآلة.
ريدج مقابل لاسو: مقارنة
- ريدج: حل مغلق الصيغة، جميع المعاملات تتقلص لكن لا تصل للصفر، أفضل عندما تكون جميع الميزات ذات صلة
- لاسو: لا حل مغلق الصيغة، كثير من المعاملات تصل للصفر بالضبط (ضآلة)، أفضل لاختيار الميزات
- Elastic Net: تركيب محدب لكلا العقوبتين — يجمع الضآلة مع الاستقرار
حيلة النواة
تفترض نماذج الانحدار والتصنيف الخطية أن حدود القرار أو دالة الانحدار خطية في الميزات. عندما يكون هذا مُقيِّداً جداً، أحد الأساليب هو تعيين البيانات إلى فضاء ميزات أعلى بُعداً حيث تعمل النماذج الخطية بشكل أفضل. حيلة النواة تتجنب حساب هذا التعيين عالي الأبعاد بشكل صريح.
لنفترض أننا نعيّن كل نقطة بيانات xᵢ إلى متجه ميزات φ(xᵢ) في فضاء ما (ربما لا نهائي الأبعاد). دالة النواة k(xᵢ, xⱼ) = φ(xᵢ)ᵀφ(xⱼ) تحسب الضرب الداخلي في هذا الفضاء من المدخلات الأصلية — دون حساب φ بشكل صريح. النوى الشائعة تشمل:
- نواة متعددة الحدود: k(x,z) = (xᵀz + c)^d — تعيين إلى ميزات متعددة الحدود من الدرجة d
- نواة RBF/الغاوسية: k(x,z) = exp(−‖x−z‖²/2σ²) — فضاء ميزات لا نهائي الأبعاد
- النواة الخطية: k(x,z) = xᵀz — تُعيد النماذج الخطية القياسية
مصفوفة النواة K (حيث Kᵢⱼ = k(xᵢ, xⱼ)) تحل محل XᵀX أو XXᵀ في المعادلات الاعتيادية. أي خوارزمية تصل إلى البيانات فقط من خلال الضربات الداخلية يمكن "نوّاتها" — بما يشمل الانحدار، PCA، وآلات المتجهات الداعمة.
الدالة k(x, z) هي نواة صحيحة إذا وفقط إذا كانت مصفوفة النواة n×n هي K متماثلة موجبة شبه محددة لأي اختيار لـ n نقطة بيانات. هذا يضمن وجود تعيين ميزات φ ويضمن أن خوارزميات النواة تقابل مسائل أمثلة محدبة.
آلات المتجهات الداعمة: منظور الجبر الخطي
تجد آلة المتجهات الداعمة (SVM) المستوى الفاصل ذا الهامش الأقصى الذي يفصل فئتين. في الحالة القابلة للفصل خطياً، المستوى الفاصل يُعرَّف بمتجه الأوزان w والإزاحة b بحيث wᵀxᵢ + b ≥ 1 للفئة +1 و wᵀxᵢ + b ≤ −1 للفئة −1. عرض الهامش هو 2/‖w‖، لذا تعظيم الهامش يُعادل تصغير ‖w‖²/2:
الثنائية Lagrangian لـ SVM-QP هي: تعظيم Σᵢ αᵢ − ½ Σᵢⱼ αᵢ αⱼ yᵢ yⱼ (xᵢᵀxⱼ)، ضمن αᵢ ≥ 0 و Σᵢ αᵢ yᵢ = 0. بما أن البيانات تظهر فقط من خلال الضربات الداخلية xᵢᵀxⱼ، استبدال هذه بنواة k(xᵢ, xⱼ) يعطي SVM بالنواة — مصنّف خطي في فضاء الميزات φ(x)، الذي قد يكون غير خطي في فضاء المدخلات الأصلي.
SVM ذات الهامش اللين
البيانات الحقيقية نادراً ما تكون قابلة للفصل خطياً. تُدخل SVM ذات الهامش اللين متغيرات فضفاضة ξᵢ ≥ 0 تسمح لبعض نقاط التدريب بانتهاك الهامش، بتكلفة تُعاقب عليها المعامل C. يصبح الهدف min ½‖w‖² + C Σᵢ ξᵢ — مفاضلة كلاسيكية بين التحيز والتباين: C الكبير يعني انخفاض خطأ التدريب (تحيز منخفض، تباين مرتفع)؛ C الصغير يسمح بانتهاكات هامشية أكثر (تحيز مرتفع، تباين منخفض).
الانحدار الخطي هو إسقاط عمودي على فضاء أعمدة مصفوفة التصميم X، بالحل المغلق β̂ = (XᵀX)⁻¹Xᵀy. انحدار ريدج يضيف λI لتثبيت الحل، مع تقليص كل مكوّن SVD بـ σ²/(σ²+λ). لاسو يستخدم عقوبة L1 التي تُنتج تلقائياً حلولاً ضئيلة — اختيار تلقائي للميزات. حيلة النواة تستبدل التعيينات الصريحة عالية الأبعاد بدوال النواة k(xᵢ,xⱼ)، مُمكِّنةً نماذج غير خطية تتحول إلى جبر خطي على مصفوفة النواة. تجد SVMs المستوى الفاصل ذا الهامش الأقصى عبر برنامج تربيعي تعتمد صياغته الثنائية فقط على الضربات الداخلية — مما يجعلها قابلة للنوّاتة بشكل طبيعي.