بنية الشبكة التلافيفية
تكديس الطبقات التلافيفية في شبكة كاملة يحتاج تصميمًا واعيًا. كم مرشّحًا؟ وكم عمقًا؟ ومتى نُجمّع؟ البنى الكلاسيكية — من LeNet إلى ResNet — تجيب على هذه الأسئلة وتكشف لماذا يهمّ العمق إلى هذا الحد.
مرشّحات كثيرة بالتوازي
الطبقة التلافيفية تُطبّق F مرشّحًا في الوقت نفسه، فتُنتج F خريطة مزايا. كل مرشّح يتعلّم كشف نمط مختلف. طبقة بـ 64 مرشّحًا على مدخل 224×224 تُنتج 64 خريطة مزايا، واحدة لكل كاشف تعلّمته الشبكة.
كم عدد الأوزان؟
كل مرشّح له k×k×C وزنًا وانحياز واحد. فطبقة بـ F مرشّحًا على مدخل بـ C قناة لها F×(k²C + 1) معاملًا — مستقلة عن الحجم المكاني H×W. هذه هي قوة مشاركة الأوزان.
التواء ← تجميع ← تكرار
الوصفة الأساسية للشبكة التلافيفية تُبادل بين الكتل التلافيفية وطبقات التجميع، فتُقلّص الحجم المكاني تدريجيًا وتُكثّر القنوات في المقابل. والطبقات الكثيفة في النهاية تُحوّل حجم المزايا الأخير إلى درجات للأصناف.
الشبكة الرائدة
- المدخل: 32×32 بتدريج رمادي (أرقام مكتوبة بخط اليد)
- مرحلتا التواء وتجميع تستخرجان المزايا المحلية
- 3 طبقات متصلة تُصنّف إلى 10 أصناف من الأرقام
- ~60K معامل — ضئيل بمقاييس اليوم
- أثبتت أن الشبكات التلافيفية تتفوق على الشبكات المتصلة بالكامل في مهام الرؤية
نذهب أعمق
- AlexNet (2012) — 5 طبقات تلافيفية، ~60M معامل، فازت في ImageNet بفارق هائل؛ وأدخلت ReLU وDropout
- VGG-16 (2014) — 13 طبقة تلافيفية، مرشّحات 3×3 فحسب؛ أثبتت أن العمق بمرشّحات صغيرة يتغلّب على العرض بمرشّحات كبيرة
- طبقتا التواء 3×3 متراكمتان لهما المجال الاستقبالي نفسه لطبقة 5×5 واحدة، لكن بمعاملات أقل وعدم خطية أكثر
الوصلات المتخطية
الشبكات العميقة جدًا تعاني من تلاشي التدرجات — الإشارة تتقلّص إلى الصفر قبل أن تصل إلى الطبقات الأولى. وتحلّ ResNet هذا باختصار متبقٍّ: المخرج هو F(x) + x. فلا تحتاج الطبقة إلا أن تتعلّم الفرق عن المطابقة.
Inception وEfficientNet
- Inception — تُطبّق مرشّحات 1×1 و3×3 و5×5 بالتوازي وتدمج النتائج؛ فتدع الشبكة تختار مجالها الاستقبالي في كل طبقة
- الالتواءات 1×1 — تخلط القنوات بتكلفة زهيدة دون تغيير الحجم المكاني؛ وتعمل كتقليل أبعاد متعلَّم
- EfficientNet — تُوسّع العمق والعرض والدقة معًا عبر معامل مركّب؛ أفضل كفاءة حتى اليوم
أعِد استخدام أوزان مُدرَّبة
- النماذج المُدرَّبة على ImageNet تعلّمت بالفعل مزايا بصرية قوية من 1.2 مليون صورة
- استخراج المزايا — جمّد كل الطبقات التلافيفية؛ ودرّب رأس تصنيف جديدًا على بياناتك فحسب
- الضبط الدقيق — افتح الطبقات الأخيرة؛ وأعِد تدريبها بمعدل تعلم صغير لتتلاءم مع مجالك
- ينجح حتى حين تختلف المجالات: التصوير الطبي، وصور الأقمار الصناعية، والتفتيش الصناعي
ما تعلّمته
الطبقة التلافيفية تُطبّق F مرشّحًا، كل منها بحجم k×k×C، فتُنتج F خريطة مزايا. ونمط التواء → ReLU → تجميع الكلاسيكي يُقلّص الحجم المكاني ويزيد العمق. LeNet مهّدت للوصفة، وAlexNet وVGG أثبتتا أن العمق يفوز، والوصلات المتخطية في ResNet جعلت الشبكات العميقة جدًا قابلة للتدريب. والتعلم بالنقل يُعيد استخدام أوزان مُدرَّبة مسبقًا، فيُتيح شبكات تلافيفية قوية حتى مع مجموعات بيانات صغيرة.