الرئيسية / تعلم الآلة 101 / الوحدة 11 / الدرس 3

النماذج التوليدية

المشفرات التغايرية، وشبكات التوليد التعاكسي، ونماذج الانتشار، والتدفقات الطبيعية — تعلّم توزيعات البيانات وتوليد صور ونصوص وصوت جديدة.

~20 دقيقة قراءة و11 · د3 متقدم

النماذج التمييزية مقابل التوليدية

تُعدّ معظم نماذج التعلم الخاضع للإشراف تمييزية: تتعلم توزيعًا شرطيًا p(y|x) — بمعنى: بمعلومية المدخل x، تنبأ بالتسمية y. أما النماذج التوليدية فتسلك نهجًا مختلفًا جذريًا: تتعلم التوزيع المشترك p(x) أو p(x, y) للبيانات ذاتها. وبمجرد تعلّمه، يمكن أخذ عينات من هذا التوزيع لاستحداث نقاط بيانات جديدة تشبه مجموعة التدريب.

لماذا يهمّ ذلك؟ تفتح النماذج التوليدية قدرات تتجاوز التصنيف: توليد صور واقعية، وإكمال البيانات المفقودة، وتعزيز مجموعات التدريب، وتعلّم تمثيلات مضغوطة، وتمكين تطبيقات الذكاء الاصطناعي الإبداعية في الفن والموسيقى واكتشاف الأدوية والمحاكاة العلمية. التحدي الجوهري أن البيانات عالية الأبعاد (صور، صوت، نص) تعيش على منوال معقد — يتطلب تعلّم توزيعه تحيزات استقرائية قوية.

التحدي الجوهري

الصورة بأبعاد 256×256 بثلاثة قنوات RGB هي نقطة في فضاء بأبعاد 196,608. مجموعة الصور الطبيعية هي مجموعة فرعية ضئيلة للغاية ومنظمة بدقة من هذا الفضاء. يجب أن تتعلم النماذج التوليدية تمركيز كتلة الاحتمالية تمامًا على هذا المنوال — دون أن يُعرَّف لها صراحةً.

المشفرات التغايرية (VAEs)

تتعلم المشفرة التغايرية نموذج متغير خفي: يُفترض أن البيانات x تُولَّد من متجه خفي منخفض الأبعاد z مُسحوب من توزيع مسبق p(z) = N(0, I)، ويمرر عبر مفكك الترميز p(x|z). يُقرِّب المشفر q(z|x) التوزيع الخلفي الصعب الحساب p(z|x) بتوزيع غاوسي مُعرَّف بالمتوسط μ والتباين σ².

هدف ELBO

لأن احتمال الهامش log p(x) الدقيق يستعصي حسابه، تُحسِّن VAEs الحد الأدنى للأدلة (ELBO):

هدف ELBO للـVAE
\mathcal{L}(\theta,\phi) = \mathbb{E}_{q_\phi(z|x)}[\log p_\theta(x|z)] - D_{\mathrm{KL}}(q_\phi(z|x)\,\|\,p(z))
حد إعادة البناء (الأول) يُشجع مفكك الترميز على استرداد x من z؛ حد KL يُنظِّم المشفر ليبقى قريبًا من التوزيع المسبق الغاوسي. تعظيم ELBO يُحكم الحد الأدنى على log p(x).

حيلة إعادة المعاملة

أخذ العينات z ~ q(z|x) يحجب تدفق التدرجات — عملية أخذ العينات غير قابلة للتفاضل. تتحايل حيلة إعادة المعاملة على ذلك: بدلًا من أخذ عينة من z مباشرة، خذ ε ~ N(0, I) واحسب z = μ + σ·ε. تنتقل العشوائية خارج الرسم البياني الحسابي، فتتدفق التدرجات عبر μ وσ إلى معاملات المشفر.

إعادة المعاملة
z = \mu_\phi(x) + \sigma_\phi(x) \cdot \varepsilon, \quad \varepsilon \sim \mathcal{N}(0, I)
ε يُسحب من غاوسي معياري ثابت؛ μ وσ دوال حتمية لـx تُخرجها شبكة المشفر. تتدفق التدرجات عبر μ وσ بشكل طبيعي.

تُنتج VAEs فضاءات خفية سلسة ومنظمة — الاستيفاء بين كودَي خفيَّين ينتج عينات وسيطة ذات معنى دلالي. غير أن مخرجات VAE غالبًا ما تكون ضبابية لأن خسارة إعادة البناء بمقياس البكسل (MSE أو BCE) تُشجع على المتوسط عبر حالات عدم اليقين. هذا القيد الرئيسي على الجودة مقارنةً بـGANs ونماذج الانتشار.

شبكات التوليد التعاكسي (GANs)

قدّمها غودفيلو وآخرون عام 2014، تُصيغ GANs التوليد على هيئة لعبة minimax بين لاعبين: مولّد G ومميِّز D. يُوصِّل المولد الضجيج z ~ p(z) إلى عينات اصطناعية G(z)؛ بينما يتعلم المميز التمييز بين البيانات الحقيقية والمزيفة. يُدرَّبان بالتناوب في مواجهة بعضهما.

هدف GAN minimax
\min_G \max_D\; \mathbb{E}_{x\sim p_{\text{data}}}[\log D(x)] + \mathbb{E}_{z\sim p_z}[\log(1-D(G(z)))]
D يُعظِّم هذا التعبير (للتمييز بين الحقيقي والمزيف)؛ G يُصغِّره (لخداع D). عند توازن ناش، يُنتج G التوزيع الحقيقي للبيانات ويُخرج D القيمة 0.5 في كل مكان.

ديناميكيات التدريب وأنماط الفشل

تدريب GAN مشهور بعدم استقراره. أبرز أنماط الفشل:

تقنيات الاستقرار

Wasserstein GAN
مسافة Earth Mover
يستبدل تباعد JS بمسافة Wasserstein-1. يُوفر تدرجات ذات معنى في كل مكان؛ يتطلب قطع الأوزان أو عقوبة التدرج (WGAN-GP).
Spectral Norm
قيد Lipschitz
يُطبِّع أوزان المميز بقيمتها الطيفية، مُفرِضًا قيد Lipschitz دون عقوبة تدرج صريحة. يُستقر التدريب بشكل ملحوظ.
النمو التدريجي
تدريب تدريجي
يبدأ بصور منخفضة الدقة (4×4) ثم يضيف طبقات أعلى دقةً تدريجيًا. استُخدم في ProGAN لإنتاج وجوه واقعية بدقة 1024×1024.
GAN الشرطي
توليد مشروط
يُكيِّف G وD على تسمية الفئة أو تضمين النص. يُتيح التوليد المتحكَّم به — استحداث فئات محددة أو صور موجَّهة بالنص.

StyleGAN

أعاد StyleGAN (NVIDIA، 2019) تصميم مولد GAN من الأساس. بدلًا من تغذية الضجيج مباشرةً في المدخل، يُحوِّل شبكة MLP ذات 8 طبقات z إلى فضاء خفي وسيط W، يُنغِّم بعدها كل طبقة من شبكة التوليف عبر التطبيع النموذجي التكيفي للنسخة (AdaIN). يفصل هذا التحكم في النمط — الميزات الكبيرة (الوضعية، الشكل) تتحكم بها الطبقات الأولى، والتفاصيل الدقيقة (الملمس، اللون) بالطبقات اللاحقة.

نماذج الانتشار

نماذج الانتشار الاحتمالية التبدُّدية (DDPMs)، التي قدّمها Ho وآخرون (2020)، باتت النموذج التوليدي السائد للصور والصوت، وتُشغِّل Stable Diffusion وDALL-E 2 وImagen وSora. تُعرِّف عملية أمامية تُضيف تدريجيًا ضجيجًا غاوسيًا إلى البيانات عبر T خطوة، ثم تُدرِّب شبكة عصبية على عكس هذه العملية.

العملية الأمامية

تُضيف العملية الأمامية q(x_t | x_{t-1}) ضجيجًا غاوسيًا في كل خطوة وفق جدول تباين β_1, ..., β_T. باستخدام الحد الهامشي في صيغة مغلقة، يمكن أخذ عينة من أي نسخة مضوضأة x_t مباشرةً من x_0 دون المرور بجميع الخطوات الوسيطة:

العملية الأمامية (صيغة مغلقة)
q(x_t|x_0) = \mathcal{N}\!\left(x_t;\,\sqrt{\bar\alpha_t}\,x_0,\,(1-\bar\alpha_t)I\right)
ᾱ_t = ∏_{s=1}^{t}(1−β_s) هو حاصل ضرب الضجيج التراكمي. مع اقتراب t من T، يتقارب x_t نحو ضجيج غاوسي خالص. يُتيح هذا التدريب على مستويات ضجيج عشوائية.

العملية العكسية والتدريب

تُقرَّب العملية العكسية p_θ(x_{t-1}|x_t) بشبكة U-Net (أو محوّل) تأخذ x_t المضوضأ والخطوة الزمنية t مدخلًا وتتنبأ بالضجيج ε المُضاف في خطوة الأمام. هدف التدريب المبسَّط:

خسارة تدريب الانتشار
\mathcal{L} = \mathbb{E}_{t,x_0,\varepsilon}\!\left[\|\varepsilon - \varepsilon_\theta(x_t, t)\|^2\right]
الشبكة ε_θ تتنبأ بالضجيج ε من x_t المضوضأ. MSE بين الضجيج المتوقع والفعلي. أثبت هذا الهدف البسيط فعاليته العالية عبر نطاقات الصور والصوت والفيديو.

التوجيه والتكييف

التوجيه الخالي من المصنِّف (CFG) هو الأسلوب السائد لتكييف نماذج الانتشار على النص أو تسميات الفئات دون مصنِّف منفصل. خلال التدريب، يُسقَط إشارة التكييف (مثل تضمين النص) عشوائيًا باحتمال p، يُدرِّب النموذج بوصفه مشروطًا وغير مشروط في آنٍ. عند الاستدلال، يُستقرأ الضجيج المتوقع بين التوقعَين المشروط وغير المشروط:

التوجيه الخالي من المصنِّف
\tilde\varepsilon_\theta(x_t, c) = \varepsilon_\theta(x_t) + w\cdot(\varepsilon_\theta(x_t, c) - \varepsilon_\theta(x_t))
w هو مقياس التوجيه (عادةً 7–15). القيم الأعلى تُشدد الالتزام بالشرط لكن تُقلص التنوع. w=1 يسترجع التوليد المشروط الاعتيادي.

نماذج الانتشار الخفية

نماذج الانتشار الخفية (LDMs)، وهي بنية Stable Diffusion، تُقلص التكلفة الحسابية بتشغيل الانتشار في الفضاء الخفي لـVAE مسبق التدريب بدلًا من فضاء البكسل. تعمل العملية على بيانات خفية بحجم 64×64 بدلًا من 512×512 بكسل — تخفيض 64× في الأبعاد. آلية الانتباه المتبادل في شبكة U-Net التبدُّدية تُحقن تكييف النص عبر تضمينات CLIP في كل طبقة.

التدفقات الطبيعية

تُعرِّف التدفقات الطبيعية نموذجًا توليديًا عبر تطبيق قابل للانعكاس وقابل للتفاضل f بين توزيع أساسي بسيط (مثل الغاوسي) والتوزيع المعقد للبيانات. بتكديس تحويلات قابلة للانعكاس متعددة، تستطيع التدفقات نمذجة توزيعات بالغة التعقيد مع الحفاظ على حساب الاحتمالية الدقيقة — ميزة فريدة لا تتوفر في VAEs وGANs.

تغيير المتغيرات
\log p_X(x) = \log p_Z(f(x)) + \log\left|\det\frac{\partial f}{\partial x}\right|
اللوغاريتم المحدد لمصفوفة يعكوب يُحاسب على تغيّر الحجم تحت التحويل f. مُصمَّمة بنى التدفق (RealNVP، Glow، FFJORD) بحيث يكون هذا المحدد رخيص الحساب.

قيد أن f يجب أن يكون قابلًا للانعكاس ذا يعكوب قابل للحساب يُحدِّد القدرة التعبيرية لكل طبقة تدفق، مما يتطلب طبقات كثيرة لنمذجة التوزيعات المعقدة. التدفقات الأكثر نجاحًا في توليف الصوت (WaveGlow) وتقدير الكثافة.

مقاييس التقييم

تقييم النماذج التوليدية صعب بشكل مشهور — الجودة الإدراكية والتنوع وتغطية التوزيع كلها مهمة، لكن لا مقياس واحد يلتقطها جميعًا.

المقياسما يقيسهالقيد
FID (Fréchet Inception Distance)المسافة بين توزيعات الميزات الحقيقية والمولَّدة (Inception-v3)حساس لحجم العينة؛ قد لا يتوافق مع الإدراك البشري
IS (Inception Score)وضوح × تنوع العينات المولَّدةيتجاهل ما إذا كانت العينات تطابق توزيع التدريب
الدقة / الاسترجاعالدقة = الجودة؛ الاسترجاع = التنوع نسبةً لمنوال البيانات الحقيقيةمكلف حسابيًا؛ يعتمد على تقدير المنوال
CLIP Scoreالتوافق الدلالي بين الصورة المولَّدة وسياق النصذو صلة بالتوليد المشروط بالنص فقط
اللوغاريتم-احتماليةدقيق للتدفقات؛ حد ELBO للـVAE؛ غير قابل للتطبيق على GANsالاحتمالية العالية لا تعني جودةً أو تنوعًا عاليَين

FID هو المعيار الفعلي لمقاييس التوليد غير المشروط والمشروط بالفئة. أقل يعني أفضل — تحقق نماذج الانتشار الرائدة FID أقل من 2 على ImageNet 256×256.

مقارنة عائلات النماذج التوليدية

عائلة النموذججودة العينةالتنوعاستقرار التدريباحتمالية دقيقة
VAEمتوسطة (ضبابية)عالٍمستقرحد ELBO الأدنى
GANعاليةخطر انهيار الأنماطغير مستقرلا
انتشارعالية جدًاعالٍمستقرحد ELBO الأدنى
تدفق طبيعيمتوسطةعالٍمستقرنعم

التطبيقات

توليف الصور
نص إلى صورة
Stable Diffusion وDALL-E 3 وMidjourney — توليد صور واقعية وفنية من سياقات نصية باستخدام LDMs.
توليد الصوت
كلام وموسيقى
WaveNet وAudioLM وMusicGen — توليد كلام وموسيقى واقعيَّين عبر نماذج انتشار أو توليد تلقائي في نطاق الموجة أو الطيف.
توليد الفيديو
تماسك زمني
Sora وStable Video Diffusion — توسيع الانتشار المكاني إلى متتاليات زمنية بشبكات U-Net ثلاثية الأبعاد أو محوّلات الفيديو.
اكتشاف الأدوية
تصميم جزيئي
RFDiffusion وDiffSBDD — نماذج انتشار على البنى ثلاثية الأبعاد للبروتينات والجزيئات. توليد جزيئات جديدة بخصائص ربط مستهدفة.
تعزيز البيانات
بيانات تدريب اصطناعية
توليد أمثلة اصطناعية موسومة للفئات النادرة أو النطاقات الحساسة للخصوصية (التصوير الطبي). قد يُحسِّن أداء المصنِّف لاحقًا.
الإكمال والتحرير
توليد مشروط
ملء المناطق المحجوبة، ونقل الأسلوب، والتحرير الدلالي عبر نماذج انتشار مشروطة (SDEdit، InstructPix2Pix).

النقاط الرئيسية

تتعلم النماذج التوليدية توزيع البيانات لاستحداث عينات جديدة. تستخدم VAEs هدف ELBO مع حيلة إعادة المعاملة — تدريب مستقر لكن مخرجات ضبابية. تصيغ GANs لعبة minimax — عينات حادة لكن تدريب غير مستقر وخطر انهيار الأنماط. تتعلم نماذج الانتشار عكس عملية إضافة الضجيج التدريجية — جودة وتنوع متقدمان، لكن أخذ العينات أبطأ. التدفقات الطبيعية ثنائيات الاتجاه القابلة للانعكاس تُتيح الاحتمالية الدقيقة. FID هو مقياس التقييم المعياري. الانتشار الخفي (Stable Diffusion) يجلب جودة الانتشار للأجهزة الاستهلاكية بالعمل في فضاء VAE الخفي. يتحكم التوجيه الخالي من المصنِّف في التوازن بين الجودة والتنوع وقت الاستدلال.

السابق و11-د2: التعلم بالنقل نظرة عامة على الوحدة الدرس التالي و12-د1: التعلم الآلي المسؤول