من العمليات إلى البنية
استعرض الدرس السابق اللبنات الأساسية: الالتواء والتجميع والخطوة والحشو. الآن نجمع هذه اللبنات في بنى كاملة. بنية الشبكة التلافيفية هي التسلسل المحدد وإعداد الطبقات — كم طبقة تلافيفية، وكم مرشّح لكل منها، وأين يحدث التجميع، وكيف تتصل خرائط المزايا المكانية في النهاية بتنبؤات الإخراج.
تصميم البنية يحدد كل شيء تقريبًا: عدد المعاملات، وحجم المجال الاستقبالي، وسرعة تدفق التدرجات أثناء التدريب، ومدى تعميم الشبكة في نهاية المطاف. تاريخ الشبكات التلافيفية هو في جوهره تاريخ بنى أفضل — كل اختراق يحل مشكلة محددة في الجيل السابق.
الطبقة التلافيفية بالتفصيل
تُعرَّف الطبقة التلافيفية الواحدة بأربعة معاملات فائقة: عدد المرشّحات F، وحجم المرشّح k×k، والخطوة s، والحشو p. كل مرشّح يُنتج خريطة مزايا واحدة — خريطة ثنائية الأبعاد لاستجابات هذا المرشّح عبر كل مواضع المدخل. مع F مرشّحًا، تُخرج الطبقة F خريطة مزايا مكدّسة في موتّر ثلاثي الأبعاد.
لصورة ملوّنة، كل مرشّح عمقه يساوي عدد قنوات المدخل C. مرشّح 3×3 مُطبَّق على صورة RGB هو في الحقيقة موتّر 3×3×3 = 27 معاملًا. ينزلق المرشّح عبر الأبعاد المكانية (الارتفاع والعرض) مُغطيًا عمق القنوات الكامل في كل موضع. خريطة المزايا الإخراجية هي خريطة ثنائية الأبعاد واحدة لكل مرشّح — يُطوى بُعد القنوات بالجمع داخل الالتواء.
بعد كل طبقة تلافيفية، تُطبَّق دالة تفعيل غير خطية عنصريًا على خرائط المزايا. الاختيار السائد هو ReLU (وحدة التصحيح الخطية): f(x) = max(0, x). تُصفّر ReLU التفعيلات السالبة وتُبقي الموجبة. رخيصة الحساب وتتجنب مشكلة اختفاء التدرج التي تُعيق دوال السيني والظل الزائج في الشبكات العميقة، وتعمل بشكل رائع عمليًا.
دالة السيني تضغط المدخلات إلى (0, 1) وتتشبّع للقيم الكبيرة الموجبة أو السالبة — فتصبح التدرجات شبه صفرية مما يُبطئ التعلم. تدرج ReLU هو 1 تمامًا للمدخلات الموجبة، فتتدفق التدرجات بحرية عبر طبقات كثيرة. ثمن ذلك هو "الخلايا الميتة": وحدات تُخرج دومًا 0 ولا تتعافى. تُعالج Leaky ReLU وELU هذا بالسماح بتدرجات صغيرة غير صفرية للمدخلات السالبة.
النمط الكلاسيكي: التواء ثم تجميع
المخطط المعياري، الذي رسخه LeNet ثم AlexNet، يتناوب بين مراحل تلافيفية ومراحل تجميع: التواء ← ReLU ← تجميع ← التواء ← ReLU ← تجميع ← … ← تسطيح ← طبقة متصلة ← Softmax. كل مرحلة تلافيفية تكتشف مزايا بمقياس أكبر تدريجيًا. كل خطوة تجميع تُنصّف الدقة المكانية مُوسّعةً المجال الاستقبالي الفعّال.
مع تقلص الأبعاد المكانية، يتضاعف عدد المرشّحات عادةً. تقدم شائع: 32 مرشّحًا في الطبقة الأولى، 64 في الثانية، 128 في الثالثة. يُبقي هذا إجمالي التفعيلات ثابتًا تقريبًا عبر الطبقات (المساحة المكانية المُنصّفة تُعوّض عدد القنوات المُضاعَف) ويُثري تمثيل المزايا تدريجيًا.
بعد طبقة التجميع الأخيرة، يُسطَّح موتّر المزايا الثلاثي الأبعاد إلى متجه أحادي الأبعاد ويُغذَّى في طبقة أو أكثر من الطبقات المتصلة بالكامل. الطبقة المتصلة النهائية تُخرج لوجيت (قيمة خام) واحدًا لكل فئة؛ تُحوّل Softmax هذه اللوجيتات إلى توزيع احتمالي. لـ C من الفئات، يكون مُخرَج Softmax: p_i = exp(z_i) / Σ_j exp(z_j)، حيث z_i هو اللوجيت رقم i.
من LeNet إلى AlexNet: إثبات المفهوم
LeNet-5 (LeCun وآخرون، 1998) كانت من أوائل الشبكات التلافيفية الناجحة، صُمّمت للتعرف على الأرقام المكتوبة بخط اليد على قاعدة MNIST. احتوت على طبقتين تلافيفيتين (مرشّحات 5×5، 6 و16 خريطة مزايا)، وتجميع متوسط، وثلاث طبقات متصلة بالكامل — نحو 60,000 معامل. أثبتت LeNet قدرة الشبكات التلافيفية على تعلم المزايا الهرمية من البكسلات الخام، لكنها بقيت محدودة بالمدخلات الصغيرة منخفضة الدقة.
AlexNet (Krizhevsky وSutskever وHinton، 2012) كانت البنية التي أعادت إشعال هذا المجال. فازت بمسابقة ImageNet LSVRC بفارق كبير (15.3% خطأ في أفضل 5 مقابل 26.2% للمنافس التالي)، وأثبتت أن الشبكات التلافيفية العميقة يمكنها السيطرة على التعرف على الصور واسعة النطاق. احتوت AlexNet على خمس طبقات تلافيفية وثلاث طبقات متصلة بالكامل وحوالي 60 مليون معامل، وبشكل حاسم استخدمت ReLU بدلًا من دالة السيني، وDropout للتنظيم، وGPU للتدريب.
كانت مسابقة ImageNet 2012 لحظة فارقة في تاريخ الذكاء الاصطناعي. صدم تحسين AlexNet بفارق 10.8 نقطة مئوية عن الحالة السابقة المجال بأكمله. خلال سنتين، تحوّل كل فريق متصدر إلى استخدام الشبكات التلافيفية. أصبح نهج التدريب بتسريع GPU الذي رسّخته AlexNet المعيار الشامل للتعلم العميق.
VGGNet (Simonyan وZisserman، 2014) استكشف تأثير العمق بوصفة بسيطة جدًا: استخدام مرشّحات 3×3 فحسب (أصغر مرشّح قادر على التقاط العلاقات المكانية يسارًا ويمينًا وأعلى وأسفل)، مع حشو متماثل دومًا، ومضاعفة عدد المرشّحات بعد كل تجميع أقصى. VGG-16 له 16 طبقة أوزان وحوالي 138 مليون معامل. انتظامه جعله سهل الفهم والتكييف، وأصبحت مزايا VGG التمثيلات المرجعية الجاهزة للاستخدام لسنوات.
الرؤية الجوهرية لـVGG: طبقتان تلافيفيتان متراكمتان بحجم 3×3 لهما نفس المجال الاستقبالي الفعّال لطبقة واحدة 5×5، لكن بمعاملات أقل (2×9 = 18 مقابل 25 لكل قناة) وعدم خطية إضافية بينهما تزيد القدرة التمييزية. ثلاث طبقات 3×3 متراكمة تُكافئ طبقة 7×7 بكفاءة أعلى. هذا المبدأ — تفضيل مرشّحات صغيرة كثيرة على مرشّحات كبيرة قليلة — أصبح قاعدة تصميم راسخة.
ResNet: حل مشكلة العمق
تكديس طبقات أكثر لا يُفيد دومًا. في مطلع الألفية الثانية، لاحظ الباحثون أن الشبكات العميقة جدًا (أكثر من 20 طبقة) تؤدي أسوأ من الأقل عمقًا على بيانات التدريب — ليس بسبب الإفراط في التخصيص فقط، بل بسبب فشل تحسيني. كانت التدرجات تتلاشى أو تنفجر أثناء انتشارها للخلف عبر عشرات الطبقات، وكانت الشبكة تكافح لتعلم حتى التعيين الهوياتي.
ResNet (He وآخرون، 2015) حل هذا بـالوصلات المتخطية (تُسمى أيضًا وصلات الاختصار). بدلًا من تعلم التعيين H(x) مباشرةً، كل كتلة متبقية تتعلم البقية F(x) = H(x) − x، ثم تُضيف المدخل x: إخراج = F(x) + x. هذا التغيير الظاهري البسيط له تأثير عميق: يمكن للتدرجات أن تتدفق مباشرةً عبر وصلة الاختصار متجاوزةً الطبقات غير الخطية بالكامل، مُمكّنةً تدريب شبكات بمئات بل آلاف الطبقات.
حقق ResNet-50 خطأ 3.6% في أفضل 5 على ImageNet — متجاوزًا الأداء على مستوى الإنسان للمرة الأولى. تتراوح عائلته بين ResNet-18 (11M معامل) وResNet-152 (60M معامل). تستخدم تصاميم العنق الزجاجي في النسخ الأعمق تواليًا 1×1 ← 3×3 ← 1×1 لتقليص عمق القنوات ثم استعادته، مُبقيةً الحساب في حدود معقولة.
Inception وEfficientNet: العرض والتحجيم
GoogLeNet / Inception (Szegedy وآخرون، 2014) اتخذ نهجًا مغايرًا: بدلًا من اختيار حجم مرشّح واحد، استخدم أحجامًا متعددة بالتوازي. تُطبّق وحدة Inception التواءات 1×1 و3×3 و5×5 في آنٍ واحد إضافةً إلى فرع تجميع أقصى، ثم تدمج مخرجاتها على امتداد القنوات. يُتيح هذا للشبكة تحديد المقياس الأنسب لكل ميزة. التواءات 1×1 قبل المرشّحات الأكبر تعمل كعنق زجاجي تُقلص الحساب تقليصًا جذريًا.
EfficientNet (Tan وLe، 2019) قدّم نهجًا مدروسًا لتحجيم الشبكات التلافيفية. التحجيم السابق كان يطال بُعدًا واحدًا: VGG يُعمّق، وWideResNet يُعرّض، وبعض النماذج تُكبّر الدقة. أثبت EfficientNet أن التحجيم المركّب — التوسع المتزامن في العمق والعرض والدقة بنسبة ثابتة — يُحقق دومًا دقة أعلى للميزانية الحسابية ذاتها. معامل تحجيم واحد φ يتحكم في مدى توسع الأبعاد الثلاثة معًا.
LeNet ≈ 99% على أرقام MNIST (1998) • AlexNet ≈ 63% على ImageNet (2012) • VGG-16 ≈ 74% (2014) • ResNet-50 ≈ 76% (2015) • EfficientNet-B7 ≈ 84% (2019). كل جيل خفّض معدل الخطأ إلى النصف تقريبًا مقارنةً بالسابق، وكثيرًا مع تقليص عدد المعاملات أيضًا.
التعلم بالنقل: ارتقِ على أكتاف العمالقة
تدريب شبكة تلافيفية من الصفر على ImageNet يستلزم ملايين الصور الموسومة وأسابيع من وقت GPU وضبطًا دقيقًا للمعاملات الفائقة. لمعظم المشكلات العملية، هذا غير ضروري: الشبكة المُدرَّبة على ImageNet بالفعل تعلمت مزايا بصرية غنية وعامة — حواف وملامس وأشكال وأجزاء أجسام — تنقل بشكل لافت إلى مجالات جديدة.
استخراج المزايا هو أبسط استراتيجيات النقل: خذ شبكة مُدرَّبة مسبقًا، أزل طبقة التصنيف النهائية، اجمّد كل الأوزان، واستخدم الشبكة المتبقية كمستخرج مزايا ثابت. مرّر صورك عبر الشبكة المجمّدة، اجمع متجهات المزايا من الطبقة قبل الأخيرة، وعلّم مصنّفًا بسيطًا (انحدار لوجستي، SVM) على تلك المزايا. يعمل هذا بشكل مدهش حتى حين يختلف المجال المستهدف اختلافًا كبيرًا عن ImageNet.
الضبط الدقيق يذهب أبعد: بعد ربط رأس تصنيف جديد بالعمود الفقري المُدرَّب مسبقًا، أكمل التدريب على بعض الطبقات أو كلها على مجموعة البيانات المستهدفة بمعدل تعلم صغير. عادةً تُضبط الطبقات الأخيرة أولًا (هي الأكثر تخصصًا لمجموعة البيانات)، ثم يمتد التدريب إلى الطبقات الأبكر إن توفرت بيانات كافية. يتفوق الضبط الدقيق عادةً على استخراج المزايا حين تتوفر بيانات موسومة كافية.
قاعدة عملية مفيدة: إن كانت مجموعة البيانات المستهدفة صغيرة ومشابهة لـImageNet، جمّد كل شيء وعلّم الرأس فحسب — معاملات أكثر من البيانات تؤدي إلى الإفراط في التخصيص. إن كانت كبيرة ومشابهة، اضبط الشبكة كاملةً. إن كانت صغيرة لكن مختلفة جدًا (مثلًا صور الأشعة الطبية)، اضبط الطبقات العليا فقط بتنظيم مكثّف. إن كانت كبيرة ومختلفة، الضبط الكامل آمن والأفضل عادةً.
جعل التعلم بالنقل رؤية الحاسوب في متناول الجميع. باحثون بمئات الصور الموسومة وحاسوب محمول بـGPU يمكنهم بلوغ دقة تنافسية في مهام عديدة بضبط ResNet أو EfficientNet المُدرَّبة مسبقًا. مستودعات مثل PyTorch Image Models (timm) وTensorFlow Hub تُتيح مئات نقاط التفتيش الجاهزة للتكييف.
- طبقة تلافيفية بـ F مرشّحًا بحجم k×k×C تحوي F×(k²×C + 1) معاملًا. تتبع تفعيل ReLU كل طبقة تلافيفية؛ تتجنب اختفاء التدرجات وحسابها رخيص.
- النمط الكلاسيكي: التواء ← ReLU ← تجميع، مكرّرًا، ثم تسطيح ← طبقة متصلة ← Softmax. تتضاعف المرشّحات مع تقلص الأبعاد المكانية، مُبقيةً حجم التفعيل ثابتًا تقريبًا.
- أثبتت LeNet المفهوم على الصور الصغيرة. وسّعته AlexNet إلى ImageNet باستخدام GPU وReLU وDropout. أظهرت VGG أن العمق مع مرشّحات 3×3 موحّدة فعّال للغاية؛ طبقتا 3×3 تُكافئ طبقة 5×5 بتكلفة أقل.
- حلّت ResNet مشكلة التدهور بالوصلات المتبقية (الاختصار): y = F(x) + x. تتدفق التدرجات عبر مسار الاختصار مُمكّنةً تدريب مئات الطبقات باستقرار.
- يستخدم Inception مرشّحات متعددة المقياس بالتوازي ويدمج مخرجاتها. يُطبّق EfficientNet التحجيم المركّب لتوسيع العمق والعرض والدقة معًا بكفاءة قصوى.
- التعلم بالنقل: استخدم شبكة مُدرَّبة على ImageNet كمستخرج مزايا أو اضبطها دقيقًا على مجموعتك. استخراج المزايا يُناسب مجموعات البيانات الصغيرة؛ الضبط الدقيق يتفوق مع توفر بيانات أكثر. اجمّد الطبقات الأولى؛ افتح الطبقات اللاحقة تدريجيًا.