قراءة
وضع القصص

نموذجك الأول في التعلم الآلي: المفهوم

~١٢ دقيقة قراءة الدرس ٣ في الوحدة ١

من البيانات إلى التنبؤات

الآن تعرف ما هو التعلم الآلي وأنواعه الثلاثة الرئيسية — التعلم الخاضع للإشراف وغير الخاضع للإشراف والتعلم المعزز. لكن كيف يتعلم نموذج التعلم الآلي فعلًا؟ في هذا الدرس، سنبني نموذجك الذهني الأول لعملية التعلم الآلي — من البيانات الخام إلى التنبؤات المدربة.

الفكرة الأساسية

نموذج التعلم الآلي هو دالة تعيّن المدخلات إلى المخرجات. بدلًا من كتابة الإنسان للقواعد، يكتشفها النموذج من البيانات عبر عملية تكرارية من التنبؤ وقياس الخطأ والتعديل.

البرمجة التقليدية: قواعد + بيانات → إجابات  |  التعلم الآلي: بيانات + إجابات → قواعد

ما هو النموذج؟

في التعلم الآلي، النموذج ببساطة دالة رياضية. تُدخل فيه مدخلات — مثل المساحة وعدد غرف النوم — ويُنتج مخرجًا — مثل سعر المنزل المتنبأ به. مهمة النموذج تعلّم التعيين الصحيح من الأمثلة.

تخيله كصندوق أسود بمقابض قابلة للتعديل بداخله. في البداية، المقابض مضبوطة عشوائيًا والتنبؤات سيئة. من خلال التدريب، يضبط النموذج هذه المقابض (تسمى المعاملات أو الأوزان) حتى تصبح تنبؤاته دقيقة.

الميزات والتسميات

كل مسألة تعلم آلي خاضعة للإشراف لها مكونان. الميزات (تسمى عادة X) هي متغيرات الإدخال — المعلومات التي يستخدمها النموذج للتنبؤ. التسميات (تسمى عادة y) هي الإجابات التي نريد من النموذج التنبؤ بها.

في كاشف البريد المزعج، الميزات قد تكون تكرارات الكلمات وسمعة المرسل وطول البريد. التسمية ثنائية: بريد مزعج أم لا. جودة ميزاتك غالبًا أهم من اختيار الخوارزمية. مدخلات رديئة تعني مخرجات رديئة.

بيانات التدريب

النموذج يتعلم من بيانات التدريب — مجموعة أمثلة نعرف فيها مسبقًا كلًا من الميزات والتسميات الصحيحة. كلما زادت الأمثلة وكانت أكثر تمثيلًا للسيناريوهات الواقعية، كان التعلم أفضل.

فكر فيها كالدراسة لامتحان: مسائل تدريب أكثر تغطي مواضيع أكثر تؤدي لأداء أفضل. لكن إذا غطت مسائلك نصف المنهج فقط، ستفشل في أسئلة النصف الآخر. بيانات تدريب متحيزة أو ناقصة تؤدي لنماذج متحيزة أو ناقصة.

حلقة التعلم

التعلم يحدث عبر حلقة تكرارية من ثلاث خطوات:

1. تنبؤ: النموذج يستخدم معاملاته الحالية للتنبؤ على بيانات التدريب.

2. قياس الخطأ: دالة الخسارة تقارن التنبؤات بالإجابات الفعلية وتنتج رقمًا واحدًا يقيس مدى خطأ النموذج.

3. تعديل: خوارزمية تحسين تعدّل المعاملات لتقليل الخطأ.

هذه الدورة تتكرر آلاف أو ملايين المرات. مع كل تكرار، يتحسن النموذج قليلًا. هذه هي الآلية الأساسية وراء كل التعلم الخاضع للإشراف.

دوال الخسارة

دالة الخسارة (أو دالة التكلفة) تقيس مدى خطأ تنبؤات النموذج. إنها بطاقة تقرير النموذج. لمسائل الانحدار — التنبؤ بقيم مستمرة مثل السعر — الخسارة الأكثر شيوعًا هي متوسط مربع الخطأ:

متوسط مربع الخطأ
\text{MSE}=\frac{1}{n}\sum_{i=1}^{n}(\hat{y}_i - y_i)^2
متوسط مربعات الفروقات بين القيم المتنبأ بها ŷᵢ والقيم الفعلية yᵢ. التربيع يعاقب الأخطاء الكبيرة أكثر من الصغيرة.

النزول التدرجي

النزول التدرجي هو كيف يعدّل النموذج معاملاته. تخيل أنك تقف على تضاريس متموجة في ضباب — لا ترى القاع لكن تشعر بالميل تحت قدميك. تخطو خطوة نحو الأسفل، ثم أخرى، وأخرى. في النهاية تصل لوادٍ.

هذا هو النزول التدرجي: احسب الميل (التدرج) للخسارة بالنسبة لكل معامل، ثم اخطُ خطوة صغيرة في الاتجاه الذي يقلل الخسارة. حجم كل خطوة هو معدل التعلم — كبير جدًا وتتجاوز الهدف؛ صغير جدًا والتدريب يستمر للأبد.

تحديث النزول التدرجي
w \leftarrow w - \alpha \frac{\partial \mathcal{L}}{\partial w}
كل معامل w يُحدَّث بطرح معدل التعلم α مضروبًا في تدرج الخسارة. هذا يحرك w في الاتجاه الذي يقلل الخسارة.

الانحدار الخطي: أبسط نموذج

أبسط نموذج تعلم آلي هو الانحدار الخطي: خط مستقيم يناسب البيانات بأفضل شكل.

النموذج الخطي
\hat{y} = wx + b
w هو الوزن (الميل)، b هو الانحياز (نقطة التقاطع). التدريب يجد قيم w وb التي تقلل الخسارة.

رغم بساطته، الانحدار الخطي واسع الاستخدام وقوي. والأهم أن كل مفهوم تناولناه — الميزات ودوال الخسارة والنزول التدرجي — ينطبق بنفس الطريقة تمامًا على الشبكات العصبية ذات ملايين المعاملات. ويتناول الدرس 2.1 الانحدار الخطي بالكامل — دالة الكلفة والنزول التدرجي والحل المغلق — حيث يُكتب الانحياز b على صورة w₀.

الإفراط في التخصيص مقابل التبسيط المفرط

الإفراط في التخصيص عندما يحفظ النموذج بيانات التدريب لكنه يفشل مع أمثلة جديدة. تعلّم الضوضاء لا الإشارة. التبسيط المفرط عندما يكون النموذج بسيطًا جدًا لالتقاط الأنماط الحقيقية في البيانات.

النقطة المثالية هي التعميم — تعلّم النمط الحقيقي الأساسي دون حفظ أمثلة محددة. هذا هو التحدي المركزي في التعلم الآلي، وجزء كبير من ممارسة التعلم الآلي يدور حول إيجاد هذا التوازن.

تقسيم التدريب/الاختبار

لكشف الإفراط في التخصيص، نحجز بعض البيانات لا يراها النموذج أثناء التدريب — مجموعة الاختبار. ندرّب على مجموعة التدريب ونُقيّم على مجموعة الاختبار. إذا أدى النموذج جيدًا على التدريب لكنه ضعيف على بيانات الاختبار، فهو مفرط التخصيص.

التقسيم النموذجي هو 80% للتدريب و20% للاختبار. هذه التقنية البسيطة هي أساس كل تقييم للنماذج في التعلم الآلي. بدونها، لا فكرة لديك إن كان نموذجك يعمل فعلًا على بيانات حقيقية.

سير عمل التعلم الآلي

1. اجمع البيانات وجهّزها → 2. قسّم إلى تدريب/اختبار → 3. درّب النموذج → 4. قيّم على مجموعة الاختبار → 5. كرّر إذا لزم الأمر. التعلم الآلي تكراري بطبيعته.

في الدرس التالي، سنتدرب عمليًا وندرّب أول نموذج تعلم آلي حقيقي — تنفيذ الانحدار الخطي من الصفر ورؤية هذه المفاهيم تنبض بالحياة مع بيانات حقيقية.

النقاط الرئيسية
  • النموذج دالة تتعلم تعيينات المدخلات-المخرجات من البيانات. الميزات (X) مدخلات؛ التسميات (y) مخرجات.
  • حلقة التعلم: تنبؤ ← قياس الخطأ (دالة الخسارة) ← تعديل المعاملات (النزول التدرجي). كرّر.
  • متوسط مربع الخطأ يقيس دقة الانحدار؛ النزول التدرجي يحسّن المعاملات باتباع المنحدر الهابط للخسارة.
  • الانحدار الخطي (y = wx + b) أبسط نموذج لكنه يوضح كل مفاهيم التعلم الآلي الأساسية.
  • الإفراط في التخصيص يحفظ الضوضاء؛ التبسيط المفرط يفوّت الأنماط. تقسيم التدريب/الاختبار يكشف الإفراط في التخصيص بالتقييم على بيانات لم يرها النموذج.
الدرس السابقأنواع التعلم الآلي نظرة عامة على الوحدة الدرس التاليالانحدار الخطي