كسر حاجز الخطية
أثبت البيرسبترون أن العصبون الاصطناعي الواحد قادر على تعلم الأنماط القابلة للفصل خطيًا. غير أن مسألة XOR وعددًا لا حصر له من المهام الواقعية تتطلب شيئًا أكثر: القدرة على رسم حدود قرار منحنية وغير منتظمة ومعقدة. كانت الإجابة واضحة أمام الجميع — تكديس البيرسبترونات فوق بعضها.
تضيف الشبكة العصبية متعددة الطبقات (MLP) طبقة أو أكثر من العصبونات بين المدخلات والمخرجات. تُسمى هذه الطبقات المخفية؛ فهي تحوّل الخصائص الخام إلى تمثيلات جديدة قبل خطوة التصنيف أو الانحدار النهائية. كل طبقة مخفية قادرة على اكتشاف أنماط أكثر تجريدًا من سابقتها: الحواف من البكسلات، ثم الأشكال من الحواف، ثم الأشياء من الأشكال. العمق يكسب القدرة التعبيرية.
الفكرة الجوهرية: تركيب تحويلات خطية متعددة لا يزال يعطي تحويلًا خطيًا. لاكتساب اللاخطية الحقيقية، يطبّق كل عصبون دالة تنشيط على مجموعه الموزون. بدون دوال التنشيط، تنهار شبكة من مئة طبقة إلى ضرب مصفوفة واحد فحسب، ولا تكون أقوى من بيرسبترون منفرد.
دوال التنشيط
تُغلّف دالة التنشيط المجموع الموزون الخطي بتحويل غير خطي. تتفاوت دوال التنشيط المختلفة في النعومة وسلوك التدرج والتكلفة الحسابية. اختيار الدالة المناسبة للطبقة المناسبة مزيج من الفن والنظرية.
يضغط السيغمويد أي عدد حقيقي إلى المجال (0، 1)، مما يجعله طبيعيًا لاحتمالات المخرجات الثنائية. عرّف الشبكات العصبية المبكرة. ثغرته الكبرى: يقترب التدرج من الصفر عند المدخلات الكبيرة جدًا أو الصغيرة جدًا، مما يسبب مشكلة التدرج المتلاشي. نادرًا ما يُستخدم في الطبقات المخفية اليوم؛ لا يزال شائعًا في طبقات المخرجات للتصنيف الثنائي.
غيّر وحدة الخطية المصحَّحة (ReLU) كل شيء. يُعرَّف ببساطة بوصفه max(0, z): يمرر القيم الموجبة كما هي ويُلغي السلبية. يبدو بسيطًا للغاية — لكن ReLU يُدرَّب بشكل أسرع بكثير من السيغمويد أو التانه في الشبكات العميقة. تدرجه إما 0 (للمدخلات السلبية) أو 1 (للموجبة)، مما يتفادى الإشباع على الجانب الموجب ويسمح للتدرجات بالتدفق بحرية عبر طبقات كثيرة.
العصبونات الميتة مخاطرة حقيقية مع ReLU. إذا جرى تحديث أوزان عصبون بحيث يكون ناتجه قبل التنشيط سالبًا دائمًا، فسيخرج 0 لكل مدخل إلى الأبد — وتدرجه 0 فلا يتلقى أي تحديث. يعالج Leaky ReLU وParametric ReLU وELU هذا بالحفاظ على تدرج صغير حيّ على الجانب السلبي.
معمارية الشبكة: العمق مقابل العرض
تُعرَّف كل MLP بعدد الطبقات وعدد العصبونات في كل طبقة ودوال التنشيط. طبقة المدخلات تحتوي على عصبون لكل خاصية. طبقة المخرجات تحتوي على عصبون لكل فئة (للتصنيف) أو عصبون واحد (للانحدار القياسي). الطبقات المخفية هي ميدان المصمم.
يشير العرض إلى عدد العصبونات في الطبقة. تستطيع الطبقة الأعرض تمثيل أنماط أكثر في تحويل واحد، لكن كل عصبون إضافي يزيد المعلمات. يشير العمق إلى عدد الطبقات المخفية. الشبكات الأعمق قادرة على تمثيل تجريدات هرمية بمعلمات أقل من الشبكات الضحلة العريضة جدًا — لكنها أصعب تدريبًا لأن التدرجات يجب أن تتدفق عبر طبقات أكثر.
يمكن لشبكة عصبية ذات طبقة مخفية واحدة بعرض كافٍ ودالة تنشيط غير خطية أن تقرّب أي دالة مستمرة على مجال مضغوط بدقة اعتباطية. أثبت سايبنكو هذه النتيجة عام 1989 للسيغمويد وعمّمها هورنيك عام 1991 على تنشيطات أخرى، مما يثبت أن شبكات MLP هي مقرِّبات دوال شاملة.
التحفظ: قد يكون “العرض الكافي” أسيًا. في التطبيق العملي، العمق — لا العرض اللامحدود — هو مفتاح التقريب الفعّال للدوال المنظمة التي تظهر في المشاكل الحقيقية. طبقتان مخفيتان بعرض معتدل تتفوقان عادةً على طبقة مخفية واحدة ضخمة.
الانتشار الأمامي
الانتشار الأمامي هو عملية حساب مخرجات الشبكة من مدخل معطى. يسير طبقة بطبقة: مخرج طبقة يصبح مدخل الطبقة التالية. تُجري كل طبقة تحويلًا خطيًا (ضرب مصفوفة زائد انحياز) يعقبه تنشيط غير خطي.
في صيغة المصفوفات، يكون معالجة دفعة كاملة من الأمثلة في آنٍ واحد أمرًا مباشرًا — كل عمود في مصفوفة التنشيط مثال واحد. هذا الحساب المجمّع يتوافق بسلاسة مع أجهزة GPU، حيث تعمل آلاف العمليات الحسابية بالتوازي. هذا أحد الأسباب التي جعلت التعلم العميق عمليًا: حوّلت وحدات GPU الانتشار الأمامي من حلقة متسلسلة إلى ضرب مصفوفة ضخم.
تنشيط طبقة المخرجات يعتمد على المهمة. للتصنيف الثنائي، يعطي مخرج السيغمويد احتمالًا في (0،1). للتصنيف متعدد الفئات، يُحوّل الـ Softmax الدرجات الخام إلى توزيع احتمالي على الفئات. للانحدار، لا تنشيط على الإطلاق — المخرج الخطي الخام هو التنبؤ.
العمق والسعة والإفراط في التخصص
إضافة طبقات تزيد سعة الشبكة — قدرتها على نمذجة دوال معقدة. لكن السعة سلاح ذو حدين. شبكة سعتها كبيرة جدًا نسبةً لبيانات التدريب ستحفظ أمثلة التدريب بدلًا من التعميم على أمثلة جديدة. هذا هو الإفراط في التخصص: تتعلم الشبكة الضوضاء في البيانات لا الإشارة.
لا تُفرط الشبكات الأعمق في التخصص أكثر من الضحلة بالضرورة — ما يهم هو نسبة المعلمات إلى أمثلة التدريب الإعلامية. شبكة من 10 طبقات مدرّبة على 10 ملايين صورة مصنّفة قد تُعمّم بشكل رائع؛ الشبكة ذاتها مدرّبة على 100 مثال ستُفرط في التخصص على الأرجح. أدوات إدارة السعة — الـ Dropout وتناقص الأوزان والتوقف المبكر — تأتي في الوحدة التالية.
تكمن قوة العمق في تركيب التمثيلات. تكتشف الطبقة 1 الأنماط المحلية (الحواف، الفونيمات، العبارات n-gram). تجمّع الطبقة 2 هذه الأنماط في هياكل أكبر (الأشكال، المقاطع، الجمل). تبني الطبقة 3 تجريدات أعلى. إعادة الاستخدام التركيبية هذه تعني أن الشبكات العميقة قادرة على تمثيل أنماط بالغة التعقيد باستخدام عصبونات أقل بكثير مقارنةً بالشبكات الضحلة — وهذه ميزة مُثبتة نظريًا لفئات معينة من الدوال.
- تتيح الطبقات المخفية للشبكة تعلم تحويلات غير خطية للمدخلات، كسرًا لحاجز الخطية الذي يقيّد البيرسبترون المنفرد.
- دوال التنشيط ضرورية: بدونها، يُنتج تكديس الطبقات الخطية تحويلًا خطيًا فحسب. ReLU هو الخيار المهيمن للطبقات المخفية اليوم.
- السيغمويد يُشبع ويسبب تلاشي التدرجات؛ التانه مُمركز لكنه يُشبع أيضًا؛ ReLU سريع التدريب لكنه قد يُنتج عصبونات ميتة؛ يعالج Leaky ReLU وGELU هذا.
- تضمن نظرية التقريب الشامل أن طبقة مخفية واحدة بعرض كافٍ تستطيع تقريب أي دالة مستمرة — لكن العمق أكفأ في التطبيق العملي.
- الانتشار الأمامي يحسب المخرجات طبقة بطبقة: z = Wa + b، ثم a = f(z). الحساب كله يُختزل في ضرب المصفوفات، مما يُمكّن التوازي على GPU.
- تستخدم طبقة المخرجات السيغمويد للتصنيف الثنائي، وSoftmax للتعدد الفئوي، ولا تنشيط للانحدار.
- يُتيح العمق تمثيلات تركيبية وقدرة تعبيرية أسية بمعلمات كثيرة — وهو السبب الجوهري لهيمنة التعلم العميق على الرؤية والكلام واللغة.