الرئيسية / LA 101 / الوحدة 11 / الدرس 3
وضع القصص

أساسيات الشبكات العصبية

الشبكات العصبية هي سلاسل من عمليات ضرب المصفوفات. الانتشار للأمام يُركِّب الخرائط الخطية؛ والانتشار للخلف يُشتقّها عبر قاعدة سلسلة Jacobian. التطبيع الدُفعي يُثبِّت التدريب؛ وآلية الانتباه تُقيِّم الصلة بتشابه حاصل الضرب النقطي.

~14 دقيقة قراءة الوحدة 11 · الدرس 3 متوسط

الشبكات كتركيب من الخرائط الخطية

تُعيِّن شبكة عصبية أمامية بعمق L متجه مدخلات x ∈ ℝⁿ إلى مخرج ŷ ∈ ℝᵐ بالتناوب بين التحويلات الخطية ودوال اللاخطية العنصرية. لكل طبقة ℓ مصفوفة أوزان W⁽ˡ⁾ ∈ ℝ^{nₗ × nₗ₋₁} وشعاع تحيّز b⁽ˡ⁾ ∈ ℝ^{nₗ}. مسار الأمام للطبقة ℓ هو:

مسار الأمام (طبقة واحدة)
z^{(\ell)} = W^{(\ell)} a^{(\ell-1)} + b^{(\ell)}, \quad a^{(\ell)} = \sigma\!\left(z^{(\ell)}\right)
z⁽ˡ⁾ هو ما قبل التنشيط (التركيب الخطي)، وa⁽ˡ⁾ هو ما بعد التنشيط، وσ هي دالة لاخطية عنصرية (ReLU أو sigmoid أو tanh). مع a⁽⁰⁾ = x، يعطي تركيب L طبقات مسار الأمام الكامل: ŷ = a⁽ᴸ⁾.

لأن كل طبقة تُطبِّق ضرب مصفوفة يتبعه دالة لاخطية، تحسب الشبكة تركيباً من الدوال. قوة العمق تأتي من هذا التركيب: كل طبقة يمكن أن تمثّل كاشف ميزات مختلف، وتجتمع معاً لبناء تمثيلات معقدة من بسيطة. بدون دالة اللاخطية σ، أي شبكة عمقها L ستنهار إلى ضرب مصفوفة واحد — لن يُضيف العمق أي ميزة تعبيرية.

الانتشار للخلف كقاعدة سلسلة Jacobian

تدريب شبكة عصبية يعني إيجاد الأوزان {W⁽ˡ⁾, b⁽ˡ⁾} التي تُصغِّر دالة الخسارة ℒ(ŷ, y). يتطلب الانحدار التدرجي حساب ∂ℒ/∂W⁽ˡ⁾ و∂ℒ/∂b⁽ˡ⁾ لكل طبقة. يحسب الانتشار للخلف هذه التدرجات بكفاءة بتطبيق قاعدة السلسلة متعددة المتغيرات للخلف عبر الشبكة.

العنصر الرئيسي هو إشارة الخطأ δ⁽ˡ⁾ = ∂ℒ/∂z⁽ˡ⁾، تدرج الخسارة بالنسبة لما قبل التنشيط في الطبقة ℓ. نبدأ من طبقة الإخراج ونتكرر للخلف:

تكرار الانتشار للخلف
\delta^{(\ell)} = \left(W^{(\ell+1)}\right)^T \delta^{(\ell+1)} \odot \sigma'\!\left(z^{(\ell)}\right)
σ'(z⁽ˡ⁾) هو مشتق دالة التنشيط عنصرياً، و⊙ هو الضرب العنصري. تدرج الوزن هو ∂ℒ/∂W⁽ˡ⁾ = δ⁽ˡ⁾(a⁽ˡ⁻¹⁾)ᵀ (حاصل الضرب الخارجي)، و∂ℒ/∂b⁽ˡ⁾ = δ⁽ˡ⁾. العامل (W⁽ˡ⁺¹⁾)ᵀ هو المنقول — يُتكرِّر الانتشار للخلف إشارات الخطأ للوراء عبر منقول مصفوفات الأوزان لمسار الأمام.

من منظور حساب المصفوفات، مسار الخلف لكل طبقة يضرب في Jacobian دالة تلك الطبقة. للطبقة z⁽ˡ⁾ = W⁽ˡ⁾a⁽ˡ⁻¹⁾ + b⁽ˡ⁾، يكون Jacobian بالنسبة لـ a⁽ˡ⁻¹⁾ هو W⁽ˡ⁾؛ لذا تضرب قاعدة السلسلة التدرج القادم في (W⁽ˡ⁾)ᵀ.

لماذا المنقول منطقي

في مسار الأمام، يُعيِّن W⁽ˡ⁾ التنشيطات ذات البُعد nₗ₋₁ إلى ما قبل التنشيط ذي البُعد nₗ. في مسار الخلف، نحتاج تعيين التدرجات من البُعد nₗ إلى البُعد nₗ₋₁ — وهو بالضبط ما يفعله (W⁽ˡ⁾)ᵀ. المنقول يعكس اتجاه الخريطة الخطية، مُتكرِّراً إشارات الخطأ للوراء عبر بنية الشبكة.

منظور الرسم الحسابي

تُطبِّق أطر التعلم العميق الحديثة (PyTorch وJAX) الانتشار للخلف عبر التفاضل التلقائي على رسم حسابي. كل عملية (ضرب مصفوفة، تنشيط، خسارة) هي عقدة؛ والحواف تحمل موترات. مسار الأمام: حساب قيم العقد. مسار الخلف: اجتياز الحواف معكوساً، تراكم التدرجات بقاعدة السلسلة عند كل عقدة. مصمّم الشبكة يُعرِّف الحساب الأمامي فقط؛ التدرجات تُحسَب تلقائياً.

التطبيع الدُفعي

الشبكات العميقة صعبة التدريب: التدرجات قد تختفي أو تنفجر عبر طبقات كثيرة، وتوزيع مدخلات كل طبقة يتغير مع تغير معاملات الطبقات السابقة — مشكلة تُسمى التحول الداخلي للمتغير الإحصائي. يعالج التطبيع الدُفعي (Ioffe وSzegedy، 2015) هذا بتطبيع ما قبل تنشيطات كل طبقة ليكون له وسط صفر وتباين وحدة داخل كل دُفعة صغيرة:

التطبيع الدُفعي
\hat{x}_i = \frac{x_i - \mu_B}{\sqrt{\sigma_B^2 + \varepsilon}}, \quad y_i = \gamma \hat{x}_i + \beta
μ_B وσ²_B هما الوسط والتباين للدُفعة محسوبين على الدُفعة الصغيرة الحالية؛ وε ثابت صغير للاستقرار العددي. المعاملات القابلة للتعلم γ وβ (التحجيم والإزاحة) تسمح للشبكة بالتراجع عن التطبيع إذا لزم. يُطبَّق التطبيع الدُفعي لكل بُعد ميزة: تنشيطات كل عصبون تُطبَّع عبر الدُفعة بشكل مستقل.

من منظور الجبر الخطي، التطبيع الدُفعي هو عملية خطية على التنشيطات: طرح شعاع الوسط وقسمة على شعاع الانحراف المعياري (كلاهما محسوب على بُعد الدُفعة)، ثم تطبيق تحويل خطي قطري قابل للتعلم diag(γ) متبوعاً بإزاحة b = β. العملية كلها قابلة للاشتقاق، لذا يعمل الانتشار للخلف دون تغيير.

آلية الانتباه

الشبكات العصبية الكلاسيكية تعالج كل موقع في المدخلات باستقلالية — يمكن للمعلومات الاختلاط فقط عبر طبقات متتالية. تسمح آلية الانتباه (Bahdanau وآخرون، 2015؛ Vaswani وآخرون، 2017) لأي موقع بالاهتمام المباشر بأي موقع آخر، مُتعلِّماً متوسطات مُرجَّحة على تسلسل المدخلات. تستخدم العملية الأساسية ثلاث مصفوفات: الاستعلامات Q والمفاتيح K والقيم V.

بناءً على تسلسل مدخلات X ∈ ℝ^{n×d} (n رمز، تضمينات d-الأبعاد)، تتشكل مصفوفات الاستعلام والمفتاح والقيمة بإسقاطات خطية: Q = XWᴼ، K = XWᴷ، V = XWⱽ، حيث Wᴼ وWᴷ وWⱽ ∈ ℝ^{d×dₖ} هي مصفوفات إسقاط مُتعلَّمة. الانتباه بحاصل الضرب النقطي المُقيَّس هو:

الانتباه بحاصل الضرب النقطي المُقيَّس
\text{Attention}(Q, K, V) = \text{softmax}\!\left(\frac{QK^T}{\sqrt{d_k}}\right) V
QKᵀ ∈ ℝ^{n×n} هي مصفوفة درجات الانتباه: العنصر (i,j) هو حاصل الضرب النقطي بين استعلام i ومفتاح j، قياساً لمدى اهتمام الرمز i بالرمز j. القسمة على √dₖ تمنع نمو حواصل الضرب في الأبعاد العالية. تُطبَّق softmax صفّياً، مُنتجةً أوزان انتباه تجمع إلى 1 لكل استعلام. المخرج متوسط مُرجَّح لشعاعات القيمة.

الجبر الخطي نظيف: QKᵀ هي مصفوفة حواصل الضرب النقطية، softmax تُطبِّع كل صف، وضرب V يحسب المتوسطات المُرجَّحة لشعاعات القيم. المخرج في الموضع i هو تركيب محدب لجميع شعاعات القيم، مُرجَّح بمدى توافق الاستعلام i مع كل مفتاح.

الانتباه متعدد الرؤوس

رأس انتباه واحد يحسب نوعاً واحداً من العلاقات. الانتباه متعدد الرؤوس يُشغِّل h عملية انتباه مستقلة بالتوازي، لكل منها مصفوفات إسقاط خاصة:

الانتباه متعدد الرؤوس
\text{MultiHead}(Q,K,V) = \text{Concat}(\text{head}_1, \ldots, \text{head}_h)\, W^O
كل رأس i يحسب Attention(QWᵢᴼ, KWᵢᴷ, VWᵢⱽ) بمصفوفات إسقاط Wᵢᴼ وWᵢᴷ وWᵢⱽ ∈ ℝ^{d×dₖ}. تُتسلسَل مخرجات h رأس وتُسقَط بـ Wᴼ ∈ ℝ^{hdₖ×d}. تتعلم رؤوس مختلفة الاهتمام بأنواع مختلفة من العلاقات في وقت واحد — النحو والإشارة المرجعية والدلالة — مما يجعل المحوّلات بالغة التعبيرية.

المحوّلات كمحركات للجبر الخطي

بنية المحوّل (Vaswani وآخرون، 2017) تُكدِّس الانتباه متعدد الرؤوس مع شبكات التغذية الأمامية الموضعية وتطبيع الطبقة والاتصالات المتبقية. من منظور الجبر الخطي، كل عملية هي إما:

الاتصال المتبقي x ← x + sublayer(x) أنيق بشكل خاص: يعني أن كل طبقة تُضيف تصحيحاً لخريطة الهوية بدلاً من حساب تمثيل جديد من الصفر. هذا يجعل تدفق التدرج مباشراً — التدرجات يمكن أن تتدفق مباشرةً من الإخراج إلى المدخل عبر فرع الهوية — مما يجعل تدريب المحوّلات العميقة (مئات الطبقات) عملياً.

لماذا √dₖ مهم

إذا كانت مدخلات Q وK مأخوذة من توزيع طبيعي معياري، فإن حاصل الضرب النقطي qᵢᵀkⱼ له تباين dₖ. لـ dₖ الكبير، هذا يدفع softmax إلى مناطق تهيمن فيها درجة واحدة وتختفي التدرجات. القسمة على √dₖ تُعيد التباين الوحدوي، إبقاء أوزان الانتباه موزّعة على مفاتيح متعددة والتدرجات صحيحة طوال التدريب.

تجميع الأمور: طبقة كخريطة خطية

كل مكوّن من مكوّنات المحوّل يمكن فهمه كخريطة خطية مُتعلَّمة (أو تركيب من الخرائط الخطية والعمليات النقطية). مصفوفات الأوزان هي المعاملات — مُتعلَّمة بالانحدار التدرجي لتصغير خسارة المهمة. يحسب الانتشار للخلف تدرجات الخسارة بالنسبة لكل مصفوفة أوزان بتطبيق قاعدة السلسلة طبقة تلو طبقة، مُتكرِّراً إشارات الخطأ للخلف عبر منقول مصفوفات الأوزان.

الحقيقة المذهلة هي أن كل هذا — مسار الأمام عبر مليارات المعاملات، مسار الخلف يحسب مليارات التدرجات — يختزل إلى ضرب مصفوفات دُفعي، العملية التي تُنفِّذها وحدات المعالجة الرسومية/TPU بأعلى كفاءة. الجبر الخطي ليس عرضياً للتعلم العميق؛ بل هو الركيزة التي يعمل عليها التعلم العميق.


النقاط الرئيسية

الشبكة العصبية هي تركيب من عمليات ضرب المصفوفات ودوال اللاخطية العنصرية. مسار الأمام يُطبِّق هذه الخرائط في تسلسل: z⁽ˡ⁾ = W⁽ˡ⁾a⁽ˡ⁻¹⁾ + b⁽ˡ⁾، وa⁽ˡ⁾ = σ(z⁽ˡ⁾). الانتشار للخلف يحسب التدرجات عبر قاعدة السلسلة، مُتكرِّراً إشارات الخطأ δ⁽ˡ⁾ للخلف عبر منقول مصفوفات الأوزان. التطبيع الدُفعي يُطبِّع ما قبل التنشيطات إلى وسط صفر وتباين وحدة داخل كل دُفعة صغيرة، باستخدام تحجيم γ وإزاحة β قابلَين للتعلم. آلية الانتباه تحسب تشابهات حاصل الضرب النقطي المُقيَّس بين الاستعلامات والمفاتيح، مُنتجةً مجاميع مُرجَّحة للقيم: Attention(Q,K,V) = softmax(QKᵀ/√dₖ)V. الانتباه متعدد الرؤوس يُشغِّل h عملية انتباه مستقلة بالتوازي، كل منها يتعلم أنواعاً مختلفة من العلاقات. المحوّلات تُكدِّس هذه المكوّنات مع الاتصالات المتبقية — مُمكِّنةً تدفق التدرج عبر مئات الطبقات — مما يجعل البنية كلها قابلة للتعبير كتسلسل من عمليات المصفوفات.