الرئيسية / تعلم الآلة 101 / الوحدة 12 / الدرس 1

التعلم الآلي المسؤول

التحيز، والعدالة، وقابلية التفسير، والخصوصية، والسلامة — المبادئ والتقنيات الأساسية لبناء أنظمة تعلم آلي جديرة بالثقة ومنصفة وخاضعة للمساءلة.

~٢٠ دقيقة قراءة و١٢ · د١ متقدم

لماذا يهم التعلم الآلي المسؤول

تتخذ أنظمة التعلم الآلي قرارات بالغة الأثر — الموافقة على القروض، وفرز المتقدمين للوظائف، وتشخيص الأمراض، وتقييم مخاطر الجريمة. حين تفشل هذه الأنظمة، لا تكون الأضرار مجردة: خوارزمية توظيف متحيزة تحرم آلاف المرشحين بصمت، ونموذج طبي سيئ المعايرة يضلل الأطباء، ونظام التعرف على الوجه يُخطئ في التعرف على شخص بريء. وعلى عكس صانع القرار البشري الفرد، يُكرر النموذج المنشور أخطاءه على نطاق واسع عبر كل تنبؤ يُجريه.

التعلم الآلي المسؤول هو ممارسة توقع هذه الأضرار وكشفها والتخفيف منها. ويشمل أربعة ركائز مترابطة: العدالة (ألا تُميّز النماذج بصورة ظالمة)، وقابلية التفسير (أن تكون قرارات النموذج مفهومة)، والخصوصية (ألا يُسرّب التدريب بيانات الأفراد الحساسة)، والسلامة والتوافق (أن تتصرف النماذج وفق المقصود حتى في بيئات موزعة أو معادية).

مشكلة النطاق

قد يؤثر محاور بشري متحيز على مئات المرشحين سنويًا. أما نموذج توظيف متحيز منتشر عبر نظام تتبع المتقدمين لشركة كبرى، فقد يؤثر على ملايين. القدر ذاته من النفوذ الذي يجعل التعلم الآلي قويًا يجعل إخفاقاته بالغة الخطر على نحو فريد.

التحيز في أنظمة التعلم الآلي

ينشأ التحيز في التعلم الآلي في مراحل متعددة من مسار العمل. يحدث التحيز التاريخي حين تعكس بيانات التدريب تمييزًا سابقًا — فالنموذج المدرَّب على الموافقات التاريخية للقروض يُرسّخ أنماط الإقراض التمييزي السابق. ويظهر تحيز التمثيل حين تكون بعض الفئات ممثلة تمثيلًا ناقصًا في بيانات التدريب، مما يُضعف الأداء لتلك الفئات. ويحدث تحيز القياس حين تقيس الميزات البديلة أو التصنيفات شيئًا مختلفًا عما يُقصد قياسه (مثل الرمز البريدي كبديل للعرق).

مصادر التحيز

التحيز التاريخي
البيانات تعكس التمييز السابق
تُرسّخ بيانات التدريب المظالم التاريخية. حتى النموذج الدقيق تمامًا على هذه البيانات يُديم المظالم السابقة ويضخمها.
تحيز التمثيل
تغطية غير متكافئة للفئات
الفئات الأقلية الممثلة تمثيلًا ناقصًا في بيانات التدريب تؤدي إلى دقة أقل لتلك الفئات — كإخفاق التعرف على الوجه للبشرة الداكنة.
تحيز القياس
مشكلات الميزات البديلة
استخدام وكلاء مترابطين (الرمز البريدي، الاسم، نوع الجهاز) يُرسّخ السمات الحساسة حتى حين يُستبعد صراحةً.
تحيز التجميع
نموذج واحد لمجموعات فرعية متعددة
نموذج واحد مدرَّب على بيانات مجمّعة قد يكون دون المستوى الأمثل لجميع المجموعات الفرعية. يمكن أن تُعين النماذج المنفصلة أو التعلم متعدد المهام.
تحيز التقييم
عدم توافق المعيار المرجعي
المعايير المرجعية التي لا تعكس التوزيع الواقعي تنتج نماذج تحصل على درجات جيدة في التقييم لكنها تؤدي بصورة غير عادلة في الانتشار.
تحيز الانتشار
انزياح التوزيع
نموذج مدرَّب ومتحقق على مجتمع ما يُنشر على مجتمع آخر. يتسبب انزياح المتغيرات المشتركة وانزياح التصنيف في تدهور الأداء وتحيزه.

مقاييس العدالة

العدالة ليست مفهومًا واحدًا محددًا بدقة — إنها عائلة من المعايير المتنافسة، وغالبًا ما تكون غير متوافقة. اختيار مقياس العدالة يُجسّد حكمًا قيميًا حول ما يُشكّل معاملة منصفة. في عام 2016، أثبت الباحثون أن كثيرًا من تعريفات العدالة الشائعة لا يمكن استيفاؤها في آنٍ واحد (نظريات الاستحالة).

معايير عدالة المجموعة

التكافؤ الديموغرافي
P(\hat{Y}=1 \mid A=0) = P(\hat{Y}=1 \mid A=1)
معدلات التنبؤ الإيجابي متساوية عبر المجموعتين A وB. لا تأخذ في الحسبان اختلافات المعدل الأساسي في النتيجة.
تكافؤ الاحتمالات
P(\hat{Y}=1 \mid Y=y, A=0) = P(\hat{Y}=1 \mid Y=y, A=1), \quad y \in \{0,1\}
معدلات الإيجابيات الحقيقية والسلبيات الكاذبة متساوية عبر المجموعات. يتطلب معدلات خطأ متساوية — وهو شرط أقوى من التكافؤ الديموغرافي.
المعيارالتعريفمتى يُستخدمالتعارضات المعروفة
التكافؤ الديموغرافيP(Ŷ=1|A=0) = P(Ŷ=1|A=1)حين لا ينبغي للمعدلات الأساسية أن تحدد النتائجغير متوافق مع المعايرة إن اختلفت المعدلات الأساسية
تكافؤ الفرصمعدل الإيجابيات الحقيقية متساوٍ عبر المجموعاتتوزيع المنافع (الوظائف، القروض)يسمح بمعدلات سلبيات كاذبة مختلفة
تكافؤ الاحتمالاتمعدل الإيجابيات الحقيقية والسلبيات الكاذبة متساوٍالقرارات عالية الخطورة (مخاطر الجريمة)غير متوافق مع المعايرة (Chouldechova 2017)
المعايرةP(Y=1|Ŷ=p) = p لجميع المجموعاتدرجات المخاطر والمخرجات الاحتماليةغير متوافق مع تكافؤ الاحتمالات إن اختلفت المعدلات
عدالة الفردالأفراد المتشابهون يحصلون على تنبؤات متشابهةحين يُعرَّف مقياس عدالة على مستوى الأفراديتطلب مقياس تشابه خاصًا بالمهمة
نتيجة الاستحالة

أثبت Chouldechova (2017) وKleinberg وآخرون (2017) أنه حين تختلف المعدلات الأساسية بين المجموعات، يصبح من المستحيل رياضيًا استيفاء المعايرة ومساواة معدلات السلبيات الكاذبة ومساواة معدلات الإيجابيات الكاذبة في آنٍ واحد. أي تدخل لصالح العدالة ينطوي بالضرورة على مقايضات — اختيار مقياس يعني اختيار أخطاء من تُعطي الأولوية لتقليلها.

قابلية التفسير (XAI)

النموذج غير القابل للفهم لا يمكن مراجعته أو تصحيحه أو الوثوق به في البيئات عالية الخطورة. يوفر الذكاء الاصطناعي القابل للتفسير (XAI) تفسيرات لاحقة أو متأصلة لتنبؤات النموذج. ثمة توتر جوهري: أكثر النماذج دقةً (الشبكات العميقة، والأشجار المعززة) هي الأقل قابليةً للتفسير، في حين أن أكثر النماذج قابليةً للتفسير (الانحدار الخطي، وأشجار القرار) غالبًا ما تكون أقل دقة.

SHAP: التفسيرات الإضافية المبنية على Shapley

يُعيّن SHAP لكل ميزة قيمة مساهمة مستندة إلى قيم Shapley من نظرية الألعاب التعاونية. قيمة Shapley للميزة i هي متوسط المساهمة الهامشية للميزة i عبر جميع تحالفات الميزات الممكنة:

قيمة Shapley
\phi_i = \sum_{S \subseteq F \setminus \{i\}} \frac{|S|!(|F|-|S|-1)!}{|F|!}\bigl[f(S \cup \{i\}) - f(S)\bigr]
S يتراوح على جميع مجموعات الميزات الفرعية التي لا تشمل i. f(S∪{i}) − f(S) يقيس المساهمة الهامشية لـ i في التحالف S. المتوسط الموزون هو قيمة Shapley φᵢ.

يستوفي SHAP أربعة بديهيات مرغوبة: الكفاءة (تجمع المساهمات وتُعطي التنبؤ ناقصًا الخط الأساسي)، والتماثل (الميزات المتساوية تحصل على قيم متساوية)، والوهمية (الميزات غير المُستخدمة تحصل على صفر)، والإضافية (تتركب المساهمات عبر النماذج). تحسب TreeSHAP قيم Shapley الدقيقة للنماذج القائمة على الأشجار في زمن O(TLD²)، مما يجعلها عملية للاستخدام في الإنتاج.

LIME: التفسيرات المحلية القابلة للتفسير وغير المعتمدة على النموذج

يُفسّر LIME تنبؤًا محددًا بملاءمة نموذج بديل بسيط (انحدار خطي أو شجرة قرار) للمنطقة المحيطة بالمثيل المُراد تفسيره. تُولَّد عينات مُشوَّهة قرب المثيل وتُصنَّف بواسطة النموذج المبهم وتُستخدم لملاءمة النموذج البديل — الذي يُستخدم بعد ذلك كتفسير.

SHAP
عالمي + محلي
مبني على أسس نظرية (قيم Shapley)، وأهمية ميزات عالمية متسقة، ويعمل مع أي نموذج. TreeSHAP فعال للمجموعات.
LIME
محلي فقط
تفسير محلي غير معتمد على النموذج عبر نموذج بديل. سريع وبديهي، لكنه غير مستقر — تغييرات صغيرة في الإدخال قد تُغير التفسيرات بشكل ملحوظ.
تصور الانتباه
نماذج المحول
يُظهر الرموز التي ينتبه إليها النموذج. بديهي لكن مثير للجدل — أوزان الانتباه لا تدل بشكل موثوق على الأهمية السببية.
Grad-CAM
تفسيرات CNN
يستخدم التدرجات المتدفقة نحو الطبقة الالتفافية الأخيرة لإنتاج خريطة توطين تُبرز مناطق الصورة المؤثرة في التصنيف.
التدرجات المتكاملة
الإسناد البديهي
تُنسب التنبؤات إلى ميزات الإدخال بتكامل التدرجات على مسار من الخط الأساسي إلى الإدخال. يستوفي بديهيتي الاكتمال والحساسية.
الحالات المضادة
إجراء التصحيح القابل للتنفيذ
يُفسّر بإيجاد الحد الأدنى من التغيير في الإدخال الذي يُقلب التنبؤ — مثل: "لو كان دخلك أعلى بـ5000 دولار، لأُقرّ القرض."

الخصوصية في التعلم الآلي

يُنشئ التدريب على البيانات الحساسة (السجلات الطبية، والمعاملات المالية، والاتصالات الخاصة) مخاطر خصوصية تتجاوز مرحلة التدريب. يمكن لـهجمات الاستدلال على العضوية تحديد ما إذا كان سجل بعينه في مجموعة التدريب؛ ويمكن لـهجمات انعكاس النموذج إعادة بناء نماذج تقريبية لعينات التدريب من مخرجات النموذج؛ ويمكن لـهجمات استخراج البيانات استرداد بيانات التدريب الحرفية من نماذج اللغة الكبيرة. يجب بناء تقنيات الحفاظ على الخصوصية في عملية التدريب ذاتها.

الخصوصية التفاضلية

توفر الخصوصية التفاضلية (DP) ضمانًا رياضيًا رسميًا: يتغير توزيع مخرجات النموذج تغيرًا طفيفًا سواء أُدرجت بيانات أي فرد في التدريب أم لا. تستوفي الخوارزمية العشوائية M متطلبات الخصوصية التفاضلية (ε، δ) إذا:

الخصوصية التفاضلية (ε, δ)
P[\mathcal{M}(D) \in S] \leq e^\varepsilon \cdot P[\mathcal{M}(D') \in S] + \delta
D و D' مجموعتا بيانات تختلفان في سجل واحد بالضبط. S أي مجموعة من المخرجات. ε يتحكم في فقدان الخصوصية (كلما صغر كان أكثر خصوصية)؛ δ هو احتمال الفشل (يُفضَّل أن يكون ≈0). تضيف الآلية القانونية ضوضاء غاوسية أو لابلاسية معيارية.

في الممارسة العملية، يُضيف DP-SGD (Abadi وآخرون، 2016) الخصوصية التفاضلية إلى تدريب الشبكات العصبية عن طريق قطع التدرجات لكل مثيل وإضافة ضوضاء غاوسية معيارية إلى مجموع التدرجات. يُحدث هذا مقايضة بين الخصوصية والأداء: تتطلب ضمانات الخصوصية الأشد (قيم ε أصغر) مزيدًا من الضوضاء، مما يُضعف دقة النموذج. في المعايير المرجعية المعتادة، يُضيف DP-SGD بـ ε=10 بضعة بالمئات من التدهور في الدقة؛ بينما قد يُضيف ε=1 ما بين 10 و20%.

التعلم الاتحادي

يُدرّب التعلم الاتحادي نموذجًا عالميًا عبر عملاء لامركزيين (مستشفيات، أجهزة محمولة) دون مركزة البيانات الخام. في كل جولة: (1) يُرسل الخادم النموذج الحالي للعملاء؛ (2) يحسب كل عميل تحديثًا تدريجيًا محليًا على بياناته الخاصة؛ (3) يُرسل العملاء تحديث التدرج فقط (لا البيانات الخام) إلى الخادم؛ (4) يُجمّع الخادم التحديثات (مثل FedAvg: المتوسط الموزون للتدرجات).

قيود التعلم الاتحادي

إرسال تدرجات النموذج لا يزال يُسرّب المعلومات — يمكن لهجمات انعكاس التدرج إعادة بناء إدخالات التدريب التقريبية من التدرجات. يوفر الجمع بين التعلم الاتحادي والخصوصية التفاضلية (بإضافة ضوضاء للتدرجات المحلية) ضمانات أقوى لكنه يُقلل الدقة أكثر. تكلفة الاتصال أيضًا كبيرة حين يكون حجم النموذج ضخمًا.

سلامة الذكاء الاصطناعي والتوافق

تهتم سلامة الذكاء الاصطناعي بما إذا كانت أنظمة الذكاء الاصطناعي تتصرف بشكل موثوق وقوي ووفقًا لنوايا الإنسان — بما في ذلك في الإعدادات الجديدة أو المعادية خارج توزيع التدريب. يشير التوافق تحديدًا إلى ضمان أن تظل أهداف النموذج وسلوكياته متوافقة مع القيم الإنسانية والنية كلما أصبحت النماذج أكثر قدرة.

الصلابة والهجمات العدائية

الشبكات العصبية هشة بصورة مفاجئة: إضافة اضطرابات مُصمَّمة بعناية لا يُدركها البشر قد تتسبب في تصنيف خاطئ بثقة عالية. تبني طريقة التدرج الإشاري السريع (FGSM) مثالًا عدائيًا باتخاذ خطوة واحدة في الاتجاه الذي يُعظّم الخسارة:

المثال العدائي FGSM
x^{\mathrm{adv}} = x + \varepsilon \cdot \mathrm{sign}\!\left(\nabla_x \mathcal{L}(\theta, x, y)\right)
ε يتحكم في حجم الاضطراب. إشارة التدرج تحدد اتجاه الهجوم. تُطبّق طريقة نزول التدرج المُسقط (PGD) هذا بصورة تكرارية لهجمات أقوى.

التدريب العدائي — إضافة أمثلة عدائية إلى مجموعة التدريب — هو أكثر الدفاعات فعالية. توفر الدفاعات المُعتمدة (التنعيم العشوائي، والانتشار بالحدود الفاصلة) ضمانات صلابة قابلة للإثبات على حساب الدقة في البيانات النظيفة. لا يوجد حتى الآن دفاع يوفر في الوقت ذاته دقة عالية في البيانات النظيفة وصلابة معتمدة للاضطرابات L∞ ذات الحجم الذي له معنى عملي.

تقنيات التوافق

RLHF
التعلم المعزز من التغذية الراجعة البشرية
تدريب نموذج مكافأة على مقارنات تفضيلات بشرية، ثم ضبط نموذج اللغة باستخدام PPO لتعظيم المكافأة المتوقعة. مُستخدم لمحاذاة ChatGPT وClaude وGemini.
الذكاء الاصطناعي الدستوري
النقد الذاتي الموجَّه بالمبادئ
ينتقد النموذج مخرجاته ويُراجعها باستخدام مجموعة من المبادئ ("الدستور") قبل خطوة RLHF الأخيرة. يُقلل الاعتماد على المصنّفين البشريين للمحتوى الضار.
الفريق الأحمر
اكتشاف الأعطال الاستباقي
اختبار عدائي من خبراء بشريين أو أنظمة آلية لاستخراج مخرجات ضارة قبل الانتشار. يجد أعطالًا يفتقدها التقييم القياسي.
بحث قابلية التفسير
الفهم الآلي
عكس هندسة الدوائر والميزات داخل الشبكات العصبية (مثل التراكب، ورؤوس الاستنتاج) لفهم ما تحسبه النماذج فعليًا وكشف السلوك الخادع.

المشهد التنظيمي

تُرسّخ الحكومات حول العالم التزامات المسؤولية في الذكاء الاصطناعي في القانون، مما يُنشئ متطلبات امتثال لممارسي التعلم الآلي.

التشريعالولاية القضائيةالمتطلبات الرئيسية
قانون الذكاء الاصطناعي الأوروبي (2024)الاتحاد الأوروبيتصنيفات قائمة على المخاطر: الاستخدامات المحظورة (التسجيل الاجتماعي)، والأنظمة عالية المخاطر (فرز السير الذاتية، والائتمان، والطب) تتطلب تقييمات المطابقة والشفافية والإشراف البشري؛ والذكاء الاصطناعي للأغراض العامة يتطلب الإفصاح عن القدرات
المادة 22 من اللائحة العامة لحماية البياناتالاتحاد الأوروبيحق عدم الخضوع لقرارات آلية بالكامل ذات آثار جوهرية؛ وحق التفسير؛ وحق الطعن
الأمر التنفيذي الأمريكي للذكاء الاصطناعي (2023)الولايات المتحدةيُلزم بتقييمات السلامة والفريق الأحمر للنماذج المتطورة؛ ويشترط وضع علامات مائية على المحتوى المولَّد بالذكاء الاصطناعي؛ ويوجّه الوكالات لتطوير توجيهات خاصة بالقطاع
إطار إدارة مخاطر الذكاء الاصطناعي NISTالولايات المتحدة (طوعي)إطار إدارة مخاطر الذكاء الاصطناعي: الحوكمة، والرسم، والقياس، والإدارة. غير إلزامي لكن مُعتمد على نطاق واسع كمعيار صناعي
لوائح الذكاء الاصطناعي الصينيةالصينتشترط لوائح الذكاء الاصطناعي التوليدي مراجعات سلامة المحتوى والتسجيل بالاسم الحقيقي وتقييمات الأمان للنماذج الكبيرة؛ تشترط لوائح التوصيات الخوارزمية الشفافية والتحكم للمستخدم

التعلم الآلي المسؤول في الممارسة

تطبيق التعلم الآلي المسؤول مشكلة اجتماعية-تقنية، وليست تقنية بحتة. تمتد القائمة التالية على دورة حياة التعلم الآلي الكاملة:

ما قبل التدريب

التدريب والتقييم

الانتشار والمراقبة


النقاط الرئيسية

يعالج التعلم الآلي المسؤول التحيز (التاريخي وتمثيل القياس)، والعدالة (تعريفات متعددة ومتعارضة — اختر بحسب السياق)، وقابلية التفسير (يستخدم SHAP قيم Shapley للإسناد العالمي والمحلي؛ يُلائم LIME نماذج بديلة محلية)، والخصوصية (توفر الخصوصية التفاضلية ضمانات رسمية؛ يُلغي التعلم الاتحادي مركزية التدريب)، والسلامة (الصلابة العدائية، والتوافق عبر RLHF والذكاء الاصطناعي الدستوري). يُعد قانون الذكاء الاصطناعي الأوروبي أشمل تشريع — يُنشئ التزامات امتثال متدرجة حسب المخاطر. التعلم الآلي المسؤول ممارسة دورة حياة، وليس قائمة مرجعية لاحقة — يجب تضمينه من صياغة المشكلة حتى المراقبة.

السابق و١١-د٣: النماذج التوليدية نظرة عامة على الوحدة الدرس التالي و١٢-د٢: الاتجاهات الناشئة