النماذج التمييزية مقابل التوليدية
تُعدّ معظم نماذج التعلم الخاضع للإشراف تمييزية: تتعلم توزيعًا شرطيًا p(y|x) — بمعنى: بمعلومية المدخل x، تنبأ بالتسمية y. أما النماذج التوليدية فتسلك نهجًا مختلفًا جذريًا: تتعلم التوزيع المشترك p(x) أو p(x, y) للبيانات ذاتها. وبمجرد تعلّمه، يمكن أخذ عينات من هذا التوزيع لاستحداث نقاط بيانات جديدة تشبه مجموعة التدريب.
لماذا يهمّ ذلك؟ تفتح النماذج التوليدية قدرات تتجاوز التصنيف: توليد صور واقعية، وإكمال البيانات المفقودة، وتعزيز مجموعات التدريب، وتعلّم تمثيلات مضغوطة، وتمكين تطبيقات الذكاء الاصطناعي الإبداعية في الفن والموسيقى واكتشاف الأدوية والمحاكاة العلمية. التحدي الجوهري أن البيانات عالية الأبعاد (صور، صوت، نص) تعيش على منوال معقد — يتطلب تعلّم توزيعه تحيزات استقرائية قوية.
الصورة بأبعاد 256×256 بثلاثة قنوات RGB هي نقطة في فضاء بأبعاد 196,608. مجموعة الصور الطبيعية هي مجموعة فرعية ضئيلة للغاية ومنظمة بدقة من هذا الفضاء. يجب أن تتعلم النماذج التوليدية تمركيز كتلة الاحتمالية تمامًا على هذا المنوال — دون أن يُعرَّف لها صراحةً.
المشفرات التغايرية (VAEs)
تتعلم المشفرة التغايرية نموذج متغير خفي: يُفترض أن البيانات x تُولَّد من متجه خفي منخفض الأبعاد z مُسحوب من توزيع مسبق p(z) = N(0, I)، ويمرر عبر مفكك الترميز p(x|z). يُقرِّب المشفر q(z|x) التوزيع الخلفي الصعب الحساب p(z|x) بتوزيع غاوسي مُعرَّف بالمتوسط μ والتباين σ².
هدف ELBO
لأن احتمال الهامش log p(x) الدقيق يستعصي حسابه، تُحسِّن VAEs الحد الأدنى للأدلة (ELBO):
حيلة إعادة المعاملة
أخذ العينات z ~ q(z|x) يحجب تدفق التدرجات — عملية أخذ العينات غير قابلة للتفاضل. تتحايل حيلة إعادة المعاملة على ذلك: بدلًا من أخذ عينة من z مباشرة، خذ ε ~ N(0, I) واحسب z = μ + σ·ε. تنتقل العشوائية خارج الرسم البياني الحسابي، فتتدفق التدرجات عبر μ وσ إلى معاملات المشفر.
تُنتج VAEs فضاءات خفية سلسة ومنظمة — الاستيفاء بين كودَي خفيَّين ينتج عينات وسيطة ذات معنى دلالي. غير أن مخرجات VAE غالبًا ما تكون ضبابية لأن خسارة إعادة البناء بمقياس البكسل (MSE أو BCE) تُشجع على المتوسط عبر حالات عدم اليقين. هذا القيد الرئيسي على الجودة مقارنةً بـGANs ونماذج الانتشار.
شبكات التوليد التعاكسي (GANs)
قدّمها غودفيلو وآخرون عام 2014، تُصيغ GANs التوليد على هيئة لعبة minimax بين لاعبين: مولّد G ومميِّز D. يُوصِّل المولد الضجيج z ~ p(z) إلى عينات اصطناعية G(z)؛ بينما يتعلم المميز التمييز بين البيانات الحقيقية والمزيفة. يُدرَّبان بالتناوب في مواجهة بعضهما.
ديناميكيات التدريب وأنماط الفشل
تدريب GAN مشهور بعدم استقراره. أبرز أنماط الفشل:
- انهيار الأنماط — يتعلم المولد إنتاج عينات قليلة فقط تخدع المميز، متجاهلًا التوزيع الكامل للبيانات
- تلاشي التدرجات — إذا قوي D مبكرًا، يتلقى G تدرجات شبه معدومة ويتوقف عن التعلم
- التذبذب — لا G ولا D يتقارب؛ تتدور الخسائر دون بلوغ توازن
تقنيات الاستقرار
StyleGAN
أعاد StyleGAN (NVIDIA، 2019) تصميم مولد GAN من الأساس. بدلًا من تغذية الضجيج مباشرةً في المدخل، يُحوِّل شبكة MLP ذات 8 طبقات z إلى فضاء خفي وسيط W، يُنغِّم بعدها كل طبقة من شبكة التوليف عبر التطبيع النموذجي التكيفي للنسخة (AdaIN). يفصل هذا التحكم في النمط — الميزات الكبيرة (الوضعية، الشكل) تتحكم بها الطبقات الأولى، والتفاصيل الدقيقة (الملمس، اللون) بالطبقات اللاحقة.
نماذج الانتشار
نماذج الانتشار الاحتمالية التبدُّدية (DDPMs)، التي قدّمها Ho وآخرون (2020)، باتت النموذج التوليدي السائد للصور والصوت، وتُشغِّل Stable Diffusion وDALL-E 2 وImagen وSora. تُعرِّف عملية أمامية تُضيف تدريجيًا ضجيجًا غاوسيًا إلى البيانات عبر T خطوة، ثم تُدرِّب شبكة عصبية على عكس هذه العملية.
العملية الأمامية
تُضيف العملية الأمامية q(x_t | x_{t-1}) ضجيجًا غاوسيًا في كل خطوة وفق جدول تباين β_1, ..., β_T. باستخدام الحد الهامشي في صيغة مغلقة، يمكن أخذ عينة من أي نسخة مضوضأة x_t مباشرةً من x_0 دون المرور بجميع الخطوات الوسيطة:
العملية العكسية والتدريب
تُقرَّب العملية العكسية p_θ(x_{t-1}|x_t) بشبكة U-Net (أو محوّل) تأخذ x_t المضوضأ والخطوة الزمنية t مدخلًا وتتنبأ بالضجيج ε المُضاف في خطوة الأمام. هدف التدريب المبسَّط:
التوجيه والتكييف
التوجيه الخالي من المصنِّف (CFG) هو الأسلوب السائد لتكييف نماذج الانتشار على النص أو تسميات الفئات دون مصنِّف منفصل. خلال التدريب، يُسقَط إشارة التكييف (مثل تضمين النص) عشوائيًا باحتمال p، يُدرِّب النموذج بوصفه مشروطًا وغير مشروط في آنٍ. عند الاستدلال، يُستقرأ الضجيج المتوقع بين التوقعَين المشروط وغير المشروط:
نماذج الانتشار الخفية
نماذج الانتشار الخفية (LDMs)، وهي بنية Stable Diffusion، تُقلص التكلفة الحسابية بتشغيل الانتشار في الفضاء الخفي لـVAE مسبق التدريب بدلًا من فضاء البكسل. تعمل العملية على بيانات خفية بحجم 64×64 بدلًا من 512×512 بكسل — تخفيض 64× في الأبعاد. آلية الانتباه المتبادل في شبكة U-Net التبدُّدية تُحقن تكييف النص عبر تضمينات CLIP في كل طبقة.
التدفقات الطبيعية
تُعرِّف التدفقات الطبيعية نموذجًا توليديًا عبر تطبيق قابل للانعكاس وقابل للتفاضل f بين توزيع أساسي بسيط (مثل الغاوسي) والتوزيع المعقد للبيانات. بتكديس تحويلات قابلة للانعكاس متعددة، تستطيع التدفقات نمذجة توزيعات بالغة التعقيد مع الحفاظ على حساب الاحتمالية الدقيقة — ميزة فريدة لا تتوفر في VAEs وGANs.
قيد أن f يجب أن يكون قابلًا للانعكاس ذا يعكوب قابل للحساب يُحدِّد القدرة التعبيرية لكل طبقة تدفق، مما يتطلب طبقات كثيرة لنمذجة التوزيعات المعقدة. التدفقات الأكثر نجاحًا في توليف الصوت (WaveGlow) وتقدير الكثافة.
مقاييس التقييم
تقييم النماذج التوليدية صعب بشكل مشهور — الجودة الإدراكية والتنوع وتغطية التوزيع كلها مهمة، لكن لا مقياس واحد يلتقطها جميعًا.
| المقياس | ما يقيسه | القيد |
|---|---|---|
| FID (Fréchet Inception Distance) | المسافة بين توزيعات الميزات الحقيقية والمولَّدة (Inception-v3) | حساس لحجم العينة؛ قد لا يتوافق مع الإدراك البشري |
| IS (Inception Score) | وضوح × تنوع العينات المولَّدة | يتجاهل ما إذا كانت العينات تطابق توزيع التدريب |
| الدقة / الاسترجاع | الدقة = الجودة؛ الاسترجاع = التنوع نسبةً لمنوال البيانات الحقيقية | مكلف حسابيًا؛ يعتمد على تقدير المنوال |
| CLIP Score | التوافق الدلالي بين الصورة المولَّدة وسياق النص | ذو صلة بالتوليد المشروط بالنص فقط |
| اللوغاريتم-احتمالية | دقيق للتدفقات؛ حد ELBO للـVAE؛ غير قابل للتطبيق على GANs | الاحتمالية العالية لا تعني جودةً أو تنوعًا عاليَين |
FID هو المعيار الفعلي لمقاييس التوليد غير المشروط والمشروط بالفئة. أقل يعني أفضل — تحقق نماذج الانتشار الرائدة FID أقل من 2 على ImageNet 256×256.
مقارنة عائلات النماذج التوليدية
| عائلة النموذج | جودة العينة | التنوع | استقرار التدريب | احتمالية دقيقة |
|---|---|---|---|---|
| VAE | متوسطة (ضبابية) | عالٍ | مستقر | حد ELBO الأدنى |
| GAN | عالية | خطر انهيار الأنماط | غير مستقر | لا |
| انتشار | عالية جدًا | عالٍ | مستقر | حد ELBO الأدنى |
| تدفق طبيعي | متوسطة | عالٍ | مستقر | نعم |
التطبيقات
تتعلم النماذج التوليدية توزيع البيانات لاستحداث عينات جديدة. تستخدم VAEs هدف ELBO مع حيلة إعادة المعاملة — تدريب مستقر لكن مخرجات ضبابية. تصيغ GANs لعبة minimax — عينات حادة لكن تدريب غير مستقر وخطر انهيار الأنماط. تتعلم نماذج الانتشار عكس عملية إضافة الضجيج التدريجية — جودة وتنوع متقدمان، لكن أخذ العينات أبطأ. التدفقات الطبيعية ثنائيات الاتجاه القابلة للانعكاس تُتيح الاحتمالية الدقيقة. FID هو مقياس التقييم المعياري. الانتشار الخفي (Stable Diffusion) يجلب جودة الانتشار للأجهزة الاستهلاكية بالعمل في فضاء VAE الخفي. يتحكم التوجيه الخالي من المصنِّف في التوازن بين الجودة والتنوع وقت الاستدلال.