قراءة
وضع القصص

تطبيقات الشبكات التلافيفية

~٢٢ دقيقة قراءة الدرس 3 من 3 في الوحدة 7

من البحث إلى العالم الحقيقي

بنى الدرسان السابقان الآليةَ الأساسية: التلافيف، التجميع، العمق، والاتصالات التخطّية. الآن نُوظِّف هذه الآلية في الواقع. تُشغِّل الشبكات التلافيفية بعضًا من أكثر التقنيات تأثيرًا المنتشرة اليوم — من الكاميرا في هاتفك إلى الأجهزة التي تقرأ صور الأشعة السينية. فهم مشهد التطبيقات يكشف ليس فقط ما تفعله الشبكات التلافيفية، بل كيف تتحوّل الأفكار المعمارية التي تعلّمتها إلى قرارات تصميمية على مستوى النظام.

تُعمَّم أنبوبة معالجة الشبكة التلافيفية الجوهرية — تعلّم ميزات هرمية، تقليص الأبعاد المكانية، التصنيف — كثيرًا ما وراء تصنيف الصور القياسي. مع رأس الإخراج الصحيح، ودالة الخسارة المناسبة، واستراتيجية البيانات الملائمة، يمكن للعمود الفقري نفسه أن يكتشف الكائنات، أو يقسِّم البكسلات، أو يتعرّف على الوجوه، أو حتى يعالج الصوت. الفكرة الجوهرية هي أن الميزات هي تمثيلات، وأن كثيرًا من مهام الإدراك تختزل في "استخراج تمثيل جيد، ثم حلّ مسألة أبسط فوقه."

تصنيف الصور على نطاق واسع

تصنيف الصور هو المهمة النموذجية للشبكات التلافيفية: بمعلومية صورة، تنبّأ بالفئة التي تنتمي إليها. يكون الإخراج توزيع احتمال على C فئة، ينتج عن تطبيق softmax على نقاط الطبقة المتّصلة بالكامل الأخيرة. يستخدم التدريب خسارة الانتروبيا المتقاطعة: −Σc yc log pc، حيث yc تساوي 1 للفئة الحقيقية و0 غير ذلك.

على نطاق الإنتاج، يجب أن تتعامل أنظمة التصنيف مع مجموعات بيانات ضخمة، واختلال توازن الفئات، والتحوّل التوزيعي بين التدريب والنشر. يعمل التوسيع بالبيانات — اقتصاص عشوائي، قلب، تشويه لوني، mixup، cutout — كمنظِّم ويحسّن القدرة على التعميم. يستبدل تنعيم التسمية الأهداف ذات الحرارة الواحدة بتوزيعات ناعمة (مثلًا 0.9 للفئة الحقيقية و0.1/C موزّعة على جميع الفئات)، مما يمنع النموذج من الإفراط في الثقة ويحسّن المعايرة.

دقة أعلى-1 مقابل أعلى-5

تُبلِّغ معايير ImageNet عن دقة أعلى-1 (التنبّؤ الأعلى احتمالًا صحيح) ودقة أعلى-5 (الفئة الصحيحة تظهر ضمن التنبّؤات الخمسة الأعلى احتمالًا). كان أعلى-5 هو المقياس الأساسي في مسابقات ImageNet المبكّرة. خطأ الإنسان في أعلى-5 نحو 5%؛ يحقّق ResNet-50 نحو 7.5%، وتدفع النماذج الحديثة هذه النسبة إلى ما دون 2%.

الكشف عن الكائنات: التحديد والتصنيف

يسأل التصنيف "ما الموجود في هذه الصورة؟" أما الكشف فيسأل "ما الموجود في هذه الصورة، وأين؟" يكون الإخراج مجموعة من مربّعات الإحاطة، مقترنة كلٌّ منها بتسمية فئة ودرجة ثقة. يكمن التحدّي في أن عدد الكائنات غير محدّد مسبّقًا، وأن الكائنات تتباين كثيرًا في الحجم ونسبة الأبعاد والموضع.

استخدمت المقاربات المبكّرة نوافذ منزلقة: تشغيل مصنِّف على كل نافذة فرعية ممكنة من كل حجم عبر الصورة. هذا غير قابل للتطبيق حسابيًا على الصور الكبيرة، لذا انتقل المجال إلى شبكات اقتراح المناطق. يستخدم Faster R-CNN (رن وآخرون، 2015) عمودً فقريًا تلافيفيًا مشتركًا لإنتاج خريطة ميزات، ثم شبكة اقتراح المناطق تقترح مربّعات إحاطة مرشّحة على تلك الخريطة. تُصنَّف المناطق المقترحة بعدئذٍ وتُنقَّح بالتوازي.

اتّخذ YOLO (أنظر مرة واحدة فقط، ريدمون وآخرون، 2016) نهجًا مختلفًا جذريًّا: صياغة الكشف كمسألة انحدار واحدة. قسِّم الصورة إلى شبكة S×S؛ تتنبّأ كل خلية بـ B مربّع إحاطة واحتمالات C فئة في آنٍ واحد في ممر واحد للأمام. YOLO أسرع بكثير من الكاشفات ذات المرحلتين ويحقّق أداءً في الوقت الفعلي (أكثر من 45 إطارًا في الثانية).

تقاطع على اتحاد (IoU)
\text{IoU} = \frac{|A \cap B|}{|A \cup B|}
يقيس IoU مدى تداخل مربّع الإحاطة المتنبَّأ به مع المربّع الحقيقي. يُعدّ التنبّؤ الذي يتجاوز IoU فيه 0.5 صحيحًا بشكل مقبول؛ IoU ≥ 0.75 معيار أصعب. يجمع متوسّط الدقة المتوسّطة (mAP) بين الدقة والاستدعاء المحدَّدَين بعتبة IoU عبر جميع الفئات.
قمع غير الحدّ الأقصى (NMS)

كثيرًا ما تُنتج الكاشفات مربّعات إحاطة متداخلة كثيرة للكائن نفسه. يعالج قمع غير الحدّ الأقصى (NMS) هذا الأمر: احتفظ بالمربّع الأعلى ثقة، واقمع كل المربّعات الأخرى التي تتداخل معه بأكثر من عتبة (مثلًا IoU > 0.5)، ثم كرِّر. NMS خطوة ما بعد معالجة تُطبَّق بعد إخراج الشبكة، وليست متعلَّمة.

التجزئة الدلالية وتجزئة المثيلات

تذهب التجزئة الدلالية إلى مستوى البكسل: تعيين تسمية فئة لكل بكسل في الصورة. هذا يتطلّب من الشبكة إنتاج إخراج بالدقة المكانية ذاتها للمدخل — عكس التصنيف الذي يضغط المعلومات المكانية في متجه واحد. الحلّ هو بنية مُشفِّر–مُفكِّك: يُقلِّص المُشفِّر (شبكة تلافيفية قياسية) الدقة المكانية تدريجيًا ويرفع عدد القنوات؛ يعكس المُفكِّك هذا بأخذ عيّنات تصاعدية من خرائط الميزات لاستعادة الدقة الكاملة.

استبدلت الشبكات التلافيفية الكاملة (FCN) (لونغ وآخرون، 2015) طبقات FC في الشبكة التلافيفية بطبقات تلافيفية 1×1، ممّا يتيح التنبّؤات لكل موضع مكاني في آنٍ واحد. تُنجَز أخذ العيّنات التصاعدية عبر تلافيفات منقولة أو استيفاء ثنائي الخطية. تُضاف الاتصالات التخطّية من خرائط ميزات المُشفِّر إلى خرائط ميزات المُفكِّك عند الدقات المتطابقة للحفاظ على التفاصيل المكانية الدقيقة.

ذهب U-Net (رونيبرغر وآخرون، 2015) بهذه الفكرة إلى أبعد مدى، ليصبح البنية السائدة لتجزئة الصور الطبية. يحتوي مُشفِّره–مُفكِّكه المتماثل على اتصالات تخطّية في كل مستوى دقة، مُربِطةً خرائط ميزات المُشفِّر مباشرة بخرائط المُفكِّك المقابلة. يتيح هذا للمُفكِّك الجمع بين المعلومات الدلالية عالية المستوى والتفاصيل المكانية منخفضة المستوى.

التجزئة الدلالية مقابل تجزئة المثيلات

تعيّن التجزئة الدلالية التسمية ذاتها لجميع بكسلات الفئة نفسها — جميع السيارات هي "سيارة" حتى لو تداخلت. تُميِّز تجزئة المثيلات الكائنات الفردية: السيارة رقم 1 والسيارة رقم 2 تحصلان على أقنعة مختلفة. يوسِّع Mask R-CNN (هي وآخرون، 2017) شبكة Faster R-CNN بفرع تنبّؤ بالقناع يعمل بالتوازي مع فرعَي التصنيف ومربّع الإحاطة.

التعرّف على الوجوه والتعلّم المتري

يختلف التعرّف على الوجوه عن التصنيف القياسي بطريقة جوهرية: مجموعة الهويّات عند النشر لا تكون ثابتة أثناء التدريب. يجب على نظام فتح قفل الهاتف التعرّف على مالكه — الشخص الذي ليس في بيانات التدريب. لا يستطيع تصنيف softmax القياسي التعميم على هويّات لم يرَها.

الحلّ هو التعلّم المتري: تدريب الشبكة التلافيفية لإنتاج متجه تضمين بحيث تكون وجوه الشخص نفسه قريبة في فضاء التضمين ووجوه الأشخاص المختلفين بعيدة. يستخدم FaceNet (شروف وآخرون، 2015) خسارة الثالوث: لكل وجه مرساة a، ومثال إيجابي p (الهوية نفسها)، ومثال سلبي n (هوية مختلفة)، تُعاقِب الخسارة الحالات التي لا يكون فيها بُعد المرساة–السلبي أكبر من بُعد المرساة–الإيجابي بهامش α على الأقل.

خسارة الثالوث
\mathcal{L} = \max\!\left(0,\; \|f(a)-f(p)\|^2 - \|f(a)-f(n)\|^2 + \alpha\right)
تدفع خسارة الثالوث بُعد المرساة–الإيجابي إلى أقل من بُعد المرساة–السلبي بهامش α. تضمن max(0, ·) صفر الخسارة حين يكون القيد محقَّقًا مسبّقًا. التعدين الصعب للسلبيات — اختيار السلبيات الأكثر إرباكًا في كل دُفعة صغيرة — ضروري للتقارع الفعّال.

يحسّن ArcFace (دينغ وآخرون، 2019) على خسارة الثالوث بإضافة هامش زاوي مُضاف إلى خسارة softmax أثناء التدريب. يُفرز التضمينات من الفئة نفسها لتتجمّع بإحكام حول مركز فئة متعلَّم في الفضاء الكروي الفائق. يحقّق ArcFace دقة شبه مثالية على معيار LFW.

نقل النمط: فصل المحتوى عن النمط

كل التطبيقات السابقة تمييزية: تبتلع الشبكة صورةً وتُخرِج تسمية أو صندوقاً أو قناعاً. يقلب نقل النمط هذا الترتيب. تُجمَّد الشبكة وتصبح الصورة هي ما يجري تحسينه — والنتيجة أوضح دليل متاح على ما تُرمِّزه فعلاً هرمية الميزات في الدرسين 7.1 و7.2.

لاحظ غاتيس وآخرون (2016) أن قراءتين مختلفتين للتنشيطات نفسها تلتقطان خاصّيتين منفصلتين. خذ خرائط ميزات الطبقة Fℓ، بعدد قنوات Nℓ مبسوطة إلى Mℓ موضعاً مكانياً لكلٍّ منها. اقرأها مباشرةً تحصل على المحتوى: أي البِنى حاضرة وأين تقع، لأن الموضع المكاني محفوظ. أما مصفوفة غرام فشيء آخر — الترابط بين كل زوج من القنوات، مجموعاً على كل المواضع المكانية. الجمع على الموضع هو ما يُسقِط أين ويُبقي أي الميزات تتواتر معاً: الملمس، وضربة الفرشاة، ولوحة الألوان. هذا هو النمط.

مصفوفة غرام لطبقة ميزات
G^{\ell}_{ij} = \sum_{k} F^{\ell}_{ik} F^{\ell}_{jk}
المُدخَل (i, j) هو الجداء الداخلي للقناة i والقناة j عبر كل مواضع الطبقة ℓ المكانية البالغة Mℓ. الجمع على k هو ما يطرح التوزيع المكاني — صورتان لهما مصفوفة غرام نفسها تتشاركان إحصاءَ ملمس، لا ترتيباً. ومطابقة مصفوفات غرام عبر عدة طبقات تعيد إنتاج النمط على عدة مقاييس دفعةً واحدة.

التخليق بعدها نزول تدرّجي عادي بمتغيّر غير معتاد. ثبِّت الأوزان المدرَّبة مسبقاً، وابدأ من ضجيج أو من صورة المحتوى، وانزل تدرّجياً على البكسلات لتصغير مجموع موزون: حدّ المحتوى، وهو مربّع الفرق بين تنشيطات الصورة المولَّدة العميقة وتنشيطات صورة المحتوى، زائد حدّ النمط، وهو مربّع الفرق بين مصفوفتَي غرام. والنسبة α/β هي القرص الجمالي الوحيد — ارفعها تنجُ الصورة الفوتوغرافية، واخفضها تسيطر اللوحة.

الطريقة الأصلية بطيئة: كل صورة مُخرَجة تحتاج مئات التمريرات الأمامية والخلفية، أي دقائق على معالج رسوميات ذلك الزمن. وقد أزال عملان لاحقان هذه الكلفة. درَّب جونسون وآخرون (2016) شبكة أمامية على خسارة إدراكية هي نفسها، فحوّلوا التحسين إلى تمريرة واحدة بثمنٍ هو شبكة مدرَّبة لكل نمط. وذهب AdaIN (هوانغ وبيلونجي، 2017) أبعد: طابِق متوسط الميزات وتباينها لكل قناة بين المحتوى والنمط، فتعمل أنماط عشوائية بتمريرة واحدة دون تدريب لكل نمط. ويعود AdaIN في الوحدة 11 بوصفه آليةَ تحكّم داخل النماذج التوليدية — المُعامِل نفسه، بوظيفة أخرى.

لماذا يقع هذا في درس التطبيقات. يُشحَن نقل النمط في كاميرات الهواتف ومحرّرات الصور، لكن إسهامه الأبقى تشخيصي. فالمحتوى والنمط ليسا متشابكين في مكانٍ ما داخل الشبكة: كلاهما قابل للاستخراج من التنشيطات نفسها بملخَّصين مختلفين، أحدهما يحفظ الموضع المكاني والآخر يُسقِطه. وهرميةٌ تسمح بهذا الفصل ليست الصندوق الأسود الذي يوحي به تعبير «الميزات العميقة».

التصوير الطبي: إدراك عالي المخاطر

يُعدّ التصوير الطبي من أكثر المجالات تأثيرًا بالنسبة للشبكات التلافيفية. يقرأ أطباء الأشعة صور الأشعة السينية للصدر، وشرائح علم الأنسجة المرضية، ومسح الشبكية، وأحجام التصوير بالرنين المغناطيسي. أثبتت الشبكات التلافيفية أداءً يضاهي الأطباء أو يفوقهم في مهام ضيّقة محدّدة: اكتشاف اعتلال الشبكية السكّري، وتحديد الالتهاب الرئوي، وتصنيف آفات الجلد.

التحدّيات مختلفة عن تصنيف الصور الطبيعية. مجموعات البيانات الطبية صغيرة (آلاف لا ملايين من العيّنات المسمَّاة). اختلال توازن الفئات حادّ — الحالات الإيجابية للمرض نادرة. التعليقات التوضيحية مكلفة وتستلزم خبرة سريرية. التحوّل التوزيعي بين المستشفيات (طراز الماسح، بروتوكول التصوير، مجتمع المرضى) منتشر وضارّ بالنماذج المنشورة.

مثال CheXNet

درَّب CheXNet (راجبوركار وآخرون، 2017) شبكة DenseNet-121 على 112,120 صورة أشعة سينية للصدر مُصنَّفة بـ 14 نتيجة مرضية. في الكشف عن الالتهاب الرئوي، تجاوز CheXNet متوسّط أداء أربعة أطباء أشعة. أثار العمل نقاشًا حول كيفية تقييم الذكاء الاصطناعي مقارنةً بالأطباء، وما هي المقاييس الصحيحة.

تهيمن U-Net وبدائلها على تجزئة الصور الطبية: تحديد حدود الأورام في التصوير بالرنين المغناطيسي، وتتبّع الأوعية في صور الشبكية، وتجزئة الأعضاء. تُوسِّع U-Net ثلاثية الأبعاد البنية إلى المدخلات الحجمية (مداخل CT/MRI) بتلافيفات ثلاثية الأبعاد.

ما وراء الرؤية: الشبكات التلافيفية للصوت والنص

عملية التلافيف ليست بصرية جوهريًا — فهي تستخرج الأنماط المحلية من أي مدخل منظَّم. في معالجة الصوت، يُحوِّل تحويل فورييه قصير المدة (STFT) الموجة الصوتية أحادية البُعد إلى طيف ثنائي الأبعاد: التردد على محور، والزمن على الآخر. تطبيق الشبكة التلافيفية على هذا التمثيل يعامل الصوت كصورة، مُستفيدًا من الآلية نفسها لتعلّم الميزات.

تنزلق التلافيفات أحادية البُعد على طول المحور الزمني للموجات الصوتية الخام أو تسلسلات الميزات. استخدم WaveNet (فان دن أورد وآخرون، 2016) تلافيفات سببية مُمدَّدة أحادية البُعد لنمذجة الصوت الخام بمعدّل 16 كيلوهرتز بحقول استقبالية تمتد لثوانٍ — منتجًا تخليق كلام بجودة استثنائية. في معالجة اللغة الطبيعية، طبّق TextCNN (كيم، 2014) تلافيفات أحادية البُعد بعروض فلاتر متعدّدة (2، 3، 4 كلمات) لتصنيف الجمل.

التلافيفات المُمدَّدة

تُدرِج التلافيفة المُمدَّدة فجوات من r−1 أصفار بين عناصر الفلتر، مُوسِّعةً حقل الاستقبال أسيًّا دون زيادة عدد المعاملات أو فقدان الدقة. فلتر عرضه 3 مع معدّل تمديد r = 4 يمتد على 9 مواضع. يتيح تكديس التلافيفات المُمدَّدة بمعدّلات متزايدة (1، 2، 4، 8، 16) حقولَ استقبالية كبيرة جدًا بتكلفة حسابية منخفضة.

النشر: الحافة مقابل السحابة

يجب نشر الشبكة التلافيفية المدرَّبة حيث تكون مطلوبة. النشر السحابي يُشغِّل الاستدلال على خادم مُسرَّع بـ GPU. نشر الحافة يُشغِّل الاستدلال على الجهاز (هاتف، كاميرا، نظام مدمج) — ذو زمن استجابة منخفض، يعمل دون اتصال، لكن مقيَّد بالذاكرة والحوسبة والبطارية.

يستلزم نشر الحافة ضغط النموذج. يُقلِّص التكميم دقة الأوزان من فاصلة عائمة 32 بت إلى عدد صحيح 8 بت (INT8)، مُقلِّصًا حجم النموذج 4 أضعاف. يُزيل التشذيب الأوزان أو القنوات بأكملها التي تقلّ قيمتها عن عتبة. يُدرِّب تقطير المعرفة شبكة "طالب" صغيرة لمحاكاة مخرجات الاحتمال الناعمة لشبكة "معلّم" كبيرة.

استبدل MobileNet (هاورد وآخرون، 2017) التلافيفات القياسية بـتلافيفات قابلة للفصل عمقيًا: فلتر مكاني مُطبَّق باستقلالية لكل قناة (تلافيف عمقي) يتبعه تلافيف 1×1 لخلط القنوات (تلافيف نقطي). يُقلِّص هذا الحوسبة بنحو 8–9 أضعاف للفلاتر 3×3 مع خسارة طفيفة في الدقة.

الاستنتاجات الرئيسية
  • يستخدم تصنيف الصور softmax وخسارة الانتروبيا المتقاطعة. التوسيع بالبيانات وتنعيم التسمية يحسّنان التعميم والمعايرة. المعايير القياسية: دقة ImageNet أعلى-1، خطأ الإنسان في أعلى-5 نحو 5%.
  • يتنبّأ كشف الكائنات بمربّعات الإحاطة وتسمياتها في آنٍ واحد. الكاشفات ذات مرحلتين (Faster R-CNN) دقيقة لكن بطيئة؛ الكاشفات ذات مرحلة واحدة (YOLO) سريعة ومناسبة للوقت الفعلي. IoU و mAP يقيسان جودة الكشف.
  • تعيّن التجزئة الدلالية فئة لكل بكسل باستخدام شبكات مُشفِّر–مُفكِّك مع اتصالات تخطّية. U-Net البنية السائدة للتجزئة الطبية. تجزئة المثيلات (Mask R-CNN) تُميِّز الكائنات الفردية إضافةً لذلك.
  • يستلزم التعرّف على الوجوه التعلّم المتري (خسارة الثالوث، ArcFace) حتى يُعمِّم النموذج على هويّات لم يرَها. الهدف فضاء تضمين تتجمّع فيه وجوه الهوية نفسها بإحكام وتتباعد فيه وجوه الهويّات المختلفة.
  • تتعميم الشبكات التلافيفية ما وراء الصور: الأطياف تُتيح تصنيف الصوت، والتلافيفات المُمدَّدة أحادية البُعد تُنمذج الموجات الصوتية (WaveNet)، والشبكات التلافيفية أحادية البُعد تعالج تصنيف النصوص بكفاءة.
  • نشر الحافة يستلزم ضغط النموذج: التكميم (INT8)، التشذيب، تقطير المعرفة، والتلافيفات القابلة للفصل عمقيًا (MobileNet) تُقلِّص الحوسبة والذاكرة لتناسب ميزانيات الأجهزة الضيّقة.
السابق بنية الشبكة التلافيفية نظرة عامة الوحدة التالية نمذجة التسلسل