قراءة
وضع القصص

أشجار القرار

~18 دقيقة قراءة الدرس 1 من 4 في الوحدة 3

التعلم بطرح الأسئلة

تخيل أنك تحاول أن تقرر هل ستلعب التنس في يوم معين. قد تسأل: هل الجو مشمس؟ إذا كان كذلك، هل الرطوبة عالية؟ وإذا لم يكن، هل هناك رياح؟ سلسلة من أسئلة نعم/لا تقودك في النهاية إلى قرار. هذا بالضبط كيف تعمل شجرة القرار — نموذج يُنشئ تنبؤات بتقسيم البيانات بشكل متكرر بناءً على قيم الميزات، متتبعًا مسارًا متفرعًا من الجذر إلى الورقة.

أشجار القرار من أكثر نماذج تعلم الآلة قابلية للتفسير. على عكس الشبكات العصبية أو آلات ناقل الدعم، يمكنك قراءة شجرة القرار كمخطط انسيابي وفهم السبب الدقيق وراء كل تنبؤ. هذه الشفافية تجعلها لا غنى عنها في الطب والمال وكل مجال تكون فيه التفسيرات بنفس أهمية الدقة.

تشريح شجرة القرار

شجرة القرار لها ثلاثة أنواع من العقد. العقدة الجذر هي قمة الشجرة — تحتوي على جميع عينات التدريب وتطبق الانقسام الأول. العقد الداخلية (تُسمى أيضًا عقد القرار) تمثل اختبارات الميزات: "هل الحرارة أكبر من 75°F؟" كل عقدة داخلية تقسم البيانات إلى فرعين أو أكثر. عقد الأوراق (العقد الطرفية) هي نقاط النهاية — لا تحتوي على مزيد من الانقسامات وتحمل التنبؤ النهائي، سواء كان تسمية صنف (للتصنيف) أو قيمة رقمية (للانحدار).

عمق الشجرة هو عدد الحواف من الجذر إلى أعمق ورقة. جذع (عمق = 1) يُنشئ انقسامًا واحدًا. الأشجار العميقة يمكنها التقاط أنماط معقدة لكنها تخاطر بالإفراط في التخصص. المسار من الجذر إلى الورقة يحدد القاعدة المستخدمة لأي تنبؤ — وهذه هي ميزة قابلية التفسير.

أشجار التصنيف مقابل الانحدار

يمكن لأشجار القرار التعامل مع كلا المهمتين. أشجار التصنيف تتنبأ بتسمية صنف منفصلة — الورقة تُعيد الصنف الأغلبي من عيناتها التدريبية. أشجار الانحدار تتنبأ بقيمة مستمرة — الورقة تُعيد متوسط عيناتها التدريبية. معايير الانقسام تختلف (جيني/إنتروبيا للتصنيف؛ التباين للانحدار)، لكن هيكل الخوارزمية متطابق.

كيفية الانقسام: مقاييس الشوائب

السؤال الجوهري في بناء الشجرة هو: على أي ميزة وعتبة يجب أن ننقسم؟ الهدف هو إيجاد انقسامات تُنشئ عقدًا فرعية أنقى ما يمكن — في المثالية، كل عقدة فرعية تحتوي على عينات من صنف واحد فقط. يُستخدم مقياسان للشوائب على نطاق واسع.

شائبة جيني تقيس احتمالية تصنيف عينة عشوائية خطأً إذا صُنِّفت وفقًا لتوزيع الصنف في العقدة. العقدة النقية (جميع العينات من نفس الصنف) لها جيني = 0. العقدة الأكثر شوائب (50/50 من صنفين) لها جيني = 0.5.

شائبة جيني
G = 1 - \sum_{k=1}^{K} p_k^2
p_k هي نسبة العينات المنتمية إلى الصنف k. تتراوح من 0 (نقية) إلى 1-1/K (أقصى شوائب).

الانتروبيا (من نظرية المعلومات) تقيس متوسط محتوى المعلومات لتسميات الصنف في العقدة. مثل جيني، الانتروبيا = 0 للعقدة النقية. حسابها أكثر تكلفة قليلًا (تتضمن لوغاريتمات) لكنها مؤسسة نظريًا في نظرية المعلومات.

الانتروبيا
H = -\sum_{k=1}^{K} p_k \log_2 p_k
انتروبيا عقدة. تُستخدم لحساب كسب المعلومات عند تقييم الانقسام.

لاختيار انقسام، تحسب الخوارزمية كسب المعلومات: الانخفاض في الانتروبيا (أو جيني) من الأب إلى الأبناء، موزونًا بنسبة العينات في كل ابن. يُختار الانقسام ذو أعلى كسب معلومات.

نمو الشجرة: خوارزمية CART

الخوارزمية الأكثر شيوعًا لبناء أشجار القرار هي CART (أشجار التصنيف والانحدار). إنها خوارزمية جشعة: في كل عقدة، تبحث استنفاذيًا في جميع الميزات وجميع العتبات الممكنة لإيجاد الانقسام الذي يُقلل الشوائب. لا تنظر إلى الأمام — يُختار أفضل انقسام محلي في كل خطوة.

الإجراء تكراري: بعد كل انقسام، تُطبَّق نفس الخوارزمية على كل عقدة فرعية بشكل مستقل، حتى يتحقق معيار التوقف. تشمل معايير التوقف الشائعة: الوصول إلى أقصى عمق للشجرة، الحد الأدنى لعدد العينات المطلوبة لانقسام عقدة، الحد الأدنى لانخفاض الشوائب المطلوب للانقسام، أو الحد الأدنى لعدد العينات المطلوبة في ورقة.

لماذا الجشع؟

إيجاد الشجرة الأمثل عالميًا غير قابل للحل حسابيًا (NP-صعب). المقاربة الجشعة تتخذ خيارات محلية مثلى في كل عقدة وتنتج نتائج معقولة في وقت متعدد الحدود. لهذا فإن أشجار القرار المبنية بـ CART ليست مثلى عالميًا — لكنها في الممارسة تعمل بشكل جيد، خاصةً عند استخدامها كمُعلِّمات أساسية في طرق التجميع.

مشكلة الإفراط في التخصص

إذا تُرك ينمو دون قيد، فإن شجرة القرار ستحفظ في نهاية المطاف بيانات التدريب بشكل مثالي — تُنشئ ورقة واحدة لكل عينة تدريبية، محققةً دقة تدريب 100%. لكن هذه الشجرة العميقة المعقدة ستُعمِّم بشكل ضعيف على البيانات الجديدة: لقد تعلمت ضوضاء مجموعة التدريب، وليس النمط الأساسي.

هذه هي مشكلة الإفراط في التخصص الكلاسيكية. شجرة القرار الواحدة عرضة بشكل خاص لهذه المشكلة بسبب تباينها العالي: التغييرات الصغيرة في بيانات التدريب يمكن أن تُنتج أشجارًا مختلفة اختلافًا جذريًا.

التقليم: التحكم في التعقيد

الأداة الرئيسية لمحاربة الإفراط في التخصص في أشجار القرار هي التقليم — إزالة أجزاء من الشجرة لا تُحسِّن التعميم. هناك مقاربتان رئيسيتان.

التقليم المسبق (التوقف المبكر) يوقف نمو الشجرة قبل أن تحفظ بيانات التدريب بالكامل. المعاملات الفائقة مثل max_depth وmin_samples_split وmin_impurity_decrease تفرض حدودًا صارمة أثناء البناء. التقليم المسبق سريع لكن يتطلب ضبطًا.

التقليم اللاحق ينمي الشجرة الكاملة أولًا، ثم يُزيل الأشجار الفرعية التي لا تُحسِّن الأداء على مجموعة التحقق. تقليم تكلفة التعقيد (يُسمى أيضًا تقليم أضعف حلقة) هو طريقة تقليم لاحق مبدئية: تضيف عقوبة α لكل ورقة، وتمسح قيم α لإيجاد الحجم الأمثل للشجرة. هذا مُطبَّق في scikit-learn كـ ccp_alpha.

أهمية الميزات

نتاج مفيد لتدريب شجرة القرار هو أهمية الميزات. لكل ميزة، نجمع إجمالي انخفاض الشوائب الذي أحدثته عبر جميع العقد التي استُخدمت فيها كانقسام، موزونًا بعدد العينات المارة عبر تلك العقد. الميزات التي تظهر بالقرب من الجذر وتقلل الشوائب بشكل كبير تُعتبر أكثر أهمية.

يعطي هذا ترتيبًا بديهيًا مستندًا إلى النموذج للميزات. غير أن أهميات الميزات في أشجار القرار يمكن أن تكون متحيزة نحو الميزات ذات الكثافة العالية (الميزات ذات القيم الفريدة الكثيرة). طرق مثل أهمية التبديل أو قيم SHAP توفر تقديرات أكثر موثوقية.

المعاملات الفائقة الرئيسية

max_depth: أقصى عمق للشجرة. أهم معامل للتنظيم. ابدأ بـ 3–5 واضبط تصاعديًا.

min_samples_split: الحد الأدنى لعدد العينات المطلوبة لانقسام عقدة داخلية. القيم الأعلى تمنع الشجرة من إنشاء انقسامات على مجموعات صغيرة جدًا، مما يقلل التباين.

min_samples_leaf: الحد الأدنى لعدد العينات المطلوبة في عقدة الورقة. يضمن أن كل تنبؤ مدعوم بعدد لا يقل عن هذا من الأمثلة التدريبية، مما يُسلِّس التنبؤات.

criterion: مقياس الشوائب المستخدم ("gini" أو "entropy" للتصنيف؛ "squared_error" للانحدار). في الممارسة، ينتج جيني والانتروبيا أشجارًا متشابهة جدًا.

المزايا والقيود

تتفوق أشجار القرار في عدة سيناريوهات. إنها قابلة للتفسير — يمكنك تصور وشرح كل تنبؤ. تتعامل مع أنواع البيانات المختلطة (الميزات الفئوية والعددية) دون معالجة مسبقة. إنها غير معلمية ولا تفترض توزيع البيانات. كما تُنجز اختيار الميزات ضمنيًا — الميزات غير ذات الصلة ببساطة لا تُستخدم في الانقسامات.

غير أن أشجار القرار لها نقاط ضعف كبيرة. لديها تباين عالٍ وهي حساسة للتغييرات الصغيرة في البيانات. يمكنها إنشاء انقسامات متحيزة مع مجموعات البيانات غير المتوازنة. الانقسامات المتوازية مع المحاور تعني أنها تكافح مع حدود القرار القطرية. وقدرتها التعبيرية محدودة مقارنةً بطرق التجميع.

في الممارسة، شجرة القرار المنفردة نادرًا ما تكون أفضل نموذج للبيانات الجدولية. أهميتها الحقيقية هي كـلبنة أساسية للتجميعات: الغابات العشوائية تتوسط أشجارًا غير مترابطة كثيرة لتقليل التباين، بينما يُدرِّب التعزيز التدريجي أشجارًا بشكل تسلسلي على البقايا لتحقيق دقة عالية.

في الدرس القادم، سنرى كيف أن الجمع بين أشجار قرار كثيرة في غابة عشوائية يُحسِّن الدقة والمتانة بشكل كبير من خلال تقليل التباين عبر تحقيق المتوسط لأشجار غير مترابطة.

النقاط الرئيسية
  • تتنبأ أشجار القرار بتقسيم البيانات بشكل متكرر باختبارات ميزات نعم/لا، متتبعةً مسارًا من الجذر إلى الورقة.
  • شائبة جيني والانتروبيا تقيسان نقاء العقدة؛ يُختار الانقسام ذو أعلى كسب معلومات في كل خطوة.
  • CART خوارزمية جشعة — تجد الانقسام المثلى محليًا في كل عقدة لكنها ليست مثلى عالميًا.
  • الأشجار غير المقيدة تُفرط في التخصص. التقليم المسبق (max_depth) والتقليم اللاحق (ccp_alpha) يتحكمان في التعقيد.
  • أهمية الميزات نتاج مفيد لكنها يمكن أن تكون متحيزة نحو الميزات ذات الكثافة العالية.
  • أشجار القرار قابلة للتفسير وتتعامل مع البيانات المختلطة ولا تتطلب تحجيم الميزات — لكن لها تباين عالٍ.
  • القيمة الحقيقية لأشجار القرار هي كلبنات أساسية لطرق التجميع: الغابات العشوائية والتعزيز التدريجي.
السابق التنظيم نظرة عامة التالي الغابات العشوائية