تطبيقات الشبكات التلافيفية
التصنيف، الكشف، التجزئة، الوجوه، الصوت، نشر الحافة — الآلية التلافيفية ذاتها تُشغِّل كل هذه التطبيقات. يستعرض هذا الدرس كيف تُوظَّف الشبكات التلافيفية في العالم الحقيقي.
Softmax والانتروبيا المتقاطعة
يُعيِّن التصنيف الصور إلى احتمال على C فئة عبر softmax. يُقلِّل التدريب خسارة الانتروبيا المتقاطعة. التوسيع بالبيانات وتنعيم التسمية يحسّنان التعميم والمعايرة على نطاق واسع.
ماذا وأين؟
يُخرج الكشف مربّعات الإحاطة وتسمياتها. تقترح الكاشفات ذات مرحلتين (Faster R-CNN) مناطق أولًا ثم تُصنِّفها. يُقاس الجودة بـ IoU بين المربّعات المتنبَّأ بها والحقيقية.
الكشف في ممر واحد
- قسِّم الصورة إلى شبكة S×S؛ تتنبّأ كل خلية بـ B مربّع واحتمالات C فئة في آنٍ واحد
- ممر أمامي واحد — أكثر من 45 إطارًا في الثانية، مناسب لفيديو الوقت الفعلي
- قمع غير الحدّ الأقصى (NMS) يُزيل مربّعات الإحاطة المتكرّرة المتداخلة
- mAP (متوسّط الدقة المتوسّطة) يجمع الدقة–الاستدعاء عبر جميع الفئات
تصنيف كل بكسل
- مُشفِّر–مُفكِّك — ضغط بالتلافيف والتجميع، ثم أخذ عيّنات تصاعدية إلى الدقة الكاملة
- الاتصالات التخطّية تنقل التفاصيل المكانية الدقيقة من المُشفِّر إلى المُفكِّك في كل مستوى دقة
- FCN (2015) استبدلت طبقات FC بتلافيفات 1×1 للتنبّؤات الكثيفة
- U-Net يُربِط خرائط المُشفِّر مباشرةً بالمُفكِّك — يهيمن على التجزئة الطبية
إدراك عالي المخاطر
- تضاهي الشبكات التلافيفية دقة الأطباء أو تتجاوزها في مهام محدّدة: اعتلال الشبكية، الالتهاب الرئوي، آفات الجلد
- تحدّيات: بيانات محدودة، اختلال حادّ في توازن الفئات، تحوّل توزيعي بين المستشفيات
- U-Net ثلاثية الأبعاد تُوسَّع إلى حجوم CT/MRI بتلافيفات ثلاثية الأبعاد
- التدريب المسبق ذاتي الإشراف على الصور غير المسمَّاة يتغلّب على شحّ البيانات
التعلّم المتري
لا يستطيع softmax القياسي التعرّف على هويّات لم يرَها أثناء التدريب. يُعيِّن التعلّم المتري الوجوه إلى تضمينات: الشخص نفسه ← قريبة، أشخاص مختلفون ← بعيدة. تُفرِز خسارة الثالوث من FaceNet هذه البنية الهندسية.
المحتوى والنمط
جمِّد الأوزان وحسِّن الصورة نفسها بدل ذلك. اقرأ خرائط الطبقة مباشرةً تحصل على المحتوى — ما الموجود، وأين. اقرأ مصفوفة غرام الخاصة بها — ترابطات القنوات مجموعةً على كل المواضع — فيسقط الموضع ويبقى الملمس ولوحة الألوان. التنشيطات نفسها، وقراءتان مختلفتان.
Gatys 2016 يحسِّن كل صورة على حدة (دقائق). Johnson 2016 يدرّب شبكة أمامية واحدة لكل نمط (تمريرة واحدة). AdaIN 2017 يطابق متوسط الميزات وتباينها — أي نمط، بتمريرة واحدة.
الشبكات التلافيفية للصوت والنص
- الأطياف الصوتية تُحوِّل الصوت إلى صور تردد–زمن ثنائية الأبعاد؛ تنطبق الشبكات التلافيفية مباشرةً
- تلافيفات أحادية البُعد تنزلق على الموجات الصوتية الخام أو تسلسلات الرموز
- WaveNet — تلافيفات سببية مُمدَّدة تُولِّد كلامًا بجودة استثنائية عند 16 كيلوهرتز
- TextCNN — فلاتر أحادية البُعد بعروض 2، 3، 4 كلمات لتصنيف الجمل
الحافة مقابل السحابة
- التكميم — أوزان INT8 تُقلِّص الحجم 4 أضعاف وتُسرِّع الاستدلال في أجهزة الحافة
- التشذيب — إزالة الأوزان شبه الصفرية أو القنوات بأكملها لشبكات متفرّقة
- التقطير — تدريب طالب صغير على المخرجات الناعمة لمعلّم كبير
- MobileNet — تلافيفات قابلة للفصل عمقيًا تُقلِّص الحوسبة 8–9 أضعاف مقارنةً بالتلافيف القياسي
ما تعلّمته
تدعم الشبكات التلافيفية تصنيف الصور، والكشف عن الكائنات (YOLO، Faster R-CNN)، والتجزئة الدلالية (U-Net)، والتعرّف على الوجوه (خسارة الثالوث)، والتصوير الطبي، والصوت (الأطياف + التلافيف أحادية البُعد)، والنص. عند الحافة، يُقلِّص التكميم والتشذيب والتقطير وتلافيفات MobileNet القابلة للفصل عمقيًا النماذجَ لتناسب ميزانيات الأجهزة الضيّقة.