الشبكات كتركيب من الخرائط الخطية
تُعيِّن شبكة عصبية أمامية بعمق L متجه مدخلات x ∈ ℝⁿ إلى مخرج ŷ ∈ ℝᵐ بالتناوب بين التحويلات الخطية ودوال اللاخطية العنصرية. لكل طبقة ℓ مصفوفة أوزان W⁽ˡ⁾ ∈ ℝ^{nₗ × nₗ₋₁} وشعاع تحيّز b⁽ˡ⁾ ∈ ℝ^{nₗ}. مسار الأمام للطبقة ℓ هو:
لأن كل طبقة تُطبِّق ضرب مصفوفة يتبعه دالة لاخطية، تحسب الشبكة تركيباً من الدوال. قوة العمق تأتي من هذا التركيب: كل طبقة يمكن أن تمثّل كاشف ميزات مختلف، وتجتمع معاً لبناء تمثيلات معقدة من بسيطة. بدون دالة اللاخطية σ، أي شبكة عمقها L ستنهار إلى ضرب مصفوفة واحد — لن يُضيف العمق أي ميزة تعبيرية.
الانتشار للخلف كقاعدة سلسلة Jacobian
تدريب شبكة عصبية يعني إيجاد الأوزان {W⁽ˡ⁾, b⁽ˡ⁾} التي تُصغِّر دالة الخسارة ℒ(ŷ, y). يتطلب الانحدار التدرجي حساب ∂ℒ/∂W⁽ˡ⁾ و∂ℒ/∂b⁽ˡ⁾ لكل طبقة. يحسب الانتشار للخلف هذه التدرجات بكفاءة بتطبيق قاعدة السلسلة متعددة المتغيرات للخلف عبر الشبكة.
العنصر الرئيسي هو إشارة الخطأ δ⁽ˡ⁾ = ∂ℒ/∂z⁽ˡ⁾، تدرج الخسارة بالنسبة لما قبل التنشيط في الطبقة ℓ. نبدأ من طبقة الإخراج ونتكرر للخلف:
من منظور حساب المصفوفات، مسار الخلف لكل طبقة يضرب في Jacobian دالة تلك الطبقة. للطبقة z⁽ˡ⁾ = W⁽ˡ⁾a⁽ˡ⁻¹⁾ + b⁽ˡ⁾، يكون Jacobian بالنسبة لـ a⁽ˡ⁻¹⁾ هو W⁽ˡ⁾؛ لذا تضرب قاعدة السلسلة التدرج القادم في (W⁽ˡ⁾)ᵀ.
في مسار الأمام، يُعيِّن W⁽ˡ⁾ التنشيطات ذات البُعد nₗ₋₁ إلى ما قبل التنشيط ذي البُعد nₗ. في مسار الخلف، نحتاج تعيين التدرجات من البُعد nₗ إلى البُعد nₗ₋₁ — وهو بالضبط ما يفعله (W⁽ˡ⁾)ᵀ. المنقول يعكس اتجاه الخريطة الخطية، مُتكرِّراً إشارات الخطأ للوراء عبر بنية الشبكة.
منظور الرسم الحسابي
تُطبِّق أطر التعلم العميق الحديثة (PyTorch وJAX) الانتشار للخلف عبر التفاضل التلقائي على رسم حسابي. كل عملية (ضرب مصفوفة، تنشيط، خسارة) هي عقدة؛ والحواف تحمل موترات. مسار الأمام: حساب قيم العقد. مسار الخلف: اجتياز الحواف معكوساً، تراكم التدرجات بقاعدة السلسلة عند كل عقدة. مصمّم الشبكة يُعرِّف الحساب الأمامي فقط؛ التدرجات تُحسَب تلقائياً.
التطبيع الدُفعي
الشبكات العميقة صعبة التدريب: التدرجات قد تختفي أو تنفجر عبر طبقات كثيرة، وتوزيع مدخلات كل طبقة يتغير مع تغير معاملات الطبقات السابقة — مشكلة تُسمى التحول الداخلي للمتغير الإحصائي. يعالج التطبيع الدُفعي (Ioffe وSzegedy، 2015) هذا بتطبيع ما قبل تنشيطات كل طبقة ليكون له وسط صفر وتباين وحدة داخل كل دُفعة صغيرة:
من منظور الجبر الخطي، التطبيع الدُفعي هو عملية خطية على التنشيطات: طرح شعاع الوسط وقسمة على شعاع الانحراف المعياري (كلاهما محسوب على بُعد الدُفعة)، ثم تطبيق تحويل خطي قطري قابل للتعلم diag(γ) متبوعاً بإزاحة b = β. العملية كلها قابلة للاشتقاق، لذا يعمل الانتشار للخلف دون تغيير.
آلية الانتباه
الشبكات العصبية الكلاسيكية تعالج كل موقع في المدخلات باستقلالية — يمكن للمعلومات الاختلاط فقط عبر طبقات متتالية. تسمح آلية الانتباه (Bahdanau وآخرون، 2015؛ Vaswani وآخرون، 2017) لأي موقع بالاهتمام المباشر بأي موقع آخر، مُتعلِّماً متوسطات مُرجَّحة على تسلسل المدخلات. تستخدم العملية الأساسية ثلاث مصفوفات: الاستعلامات Q والمفاتيح K والقيم V.
بناءً على تسلسل مدخلات X ∈ ℝ^{n×d} (n رمز، تضمينات d-الأبعاد)، تتشكل مصفوفات الاستعلام والمفتاح والقيمة بإسقاطات خطية: Q = XWᴼ، K = XWᴷ، V = XWⱽ، حيث Wᴼ وWᴷ وWⱽ ∈ ℝ^{d×dₖ} هي مصفوفات إسقاط مُتعلَّمة. الانتباه بحاصل الضرب النقطي المُقيَّس هو:
الجبر الخطي نظيف: QKᵀ هي مصفوفة حواصل الضرب النقطية، softmax تُطبِّع كل صف، وضرب V يحسب المتوسطات المُرجَّحة لشعاعات القيم. المخرج في الموضع i هو تركيب محدب لجميع شعاعات القيم، مُرجَّح بمدى توافق الاستعلام i مع كل مفتاح.
الانتباه متعدد الرؤوس
رأس انتباه واحد يحسب نوعاً واحداً من العلاقات. الانتباه متعدد الرؤوس يُشغِّل h عملية انتباه مستقلة بالتوازي، لكل منها مصفوفات إسقاط خاصة:
المحوّلات كمحركات للجبر الخطي
بنية المحوّل (Vaswani وآخرون، 2017) تُكدِّس الانتباه متعدد الرؤوس مع شبكات التغذية الأمامية الموضعية وتطبيع الطبقة والاتصالات المتبقية. من منظور الجبر الخطي، كل عملية هي إما:
- ضرب مصفوفات: إسقاطات QKV وإسقاط الإخراج وطبقات التغذية الأمامية (كلها خرائط خطية)
- تطبيع: تطبيع الطبقة أو الدُفعة (تمركز حول الوسط + تحجيم قطري)
- لاخطية: softmax في الانتباه، ReLU/GELU في طبقات التغذية الأمامية
- جمع: الاتصالات المتبقية (x ← x + sublayer(x))
الاتصال المتبقي x ← x + sublayer(x) أنيق بشكل خاص: يعني أن كل طبقة تُضيف تصحيحاً لخريطة الهوية بدلاً من حساب تمثيل جديد من الصفر. هذا يجعل تدفق التدرج مباشراً — التدرجات يمكن أن تتدفق مباشرةً من الإخراج إلى المدخل عبر فرع الهوية — مما يجعل تدريب المحوّلات العميقة (مئات الطبقات) عملياً.
إذا كانت مدخلات Q وK مأخوذة من توزيع طبيعي معياري، فإن حاصل الضرب النقطي qᵢᵀkⱼ له تباين dₖ. لـ dₖ الكبير، هذا يدفع softmax إلى مناطق تهيمن فيها درجة واحدة وتختفي التدرجات. القسمة على √dₖ تُعيد التباين الوحدوي، إبقاء أوزان الانتباه موزّعة على مفاتيح متعددة والتدرجات صحيحة طوال التدريب.
تجميع الأمور: طبقة كخريطة خطية
كل مكوّن من مكوّنات المحوّل يمكن فهمه كخريطة خطية مُتعلَّمة (أو تركيب من الخرائط الخطية والعمليات النقطية). مصفوفات الأوزان هي المعاملات — مُتعلَّمة بالانحدار التدرجي لتصغير خسارة المهمة. يحسب الانتشار للخلف تدرجات الخسارة بالنسبة لكل مصفوفة أوزان بتطبيق قاعدة السلسلة طبقة تلو طبقة، مُتكرِّراً إشارات الخطأ للخلف عبر منقول مصفوفات الأوزان.
الحقيقة المذهلة هي أن كل هذا — مسار الأمام عبر مليارات المعاملات، مسار الخلف يحسب مليارات التدرجات — يختزل إلى ضرب مصفوفات دُفعي، العملية التي تُنفِّذها وحدات المعالجة الرسومية/TPU بأعلى كفاءة. الجبر الخطي ليس عرضياً للتعلم العميق؛ بل هو الركيزة التي يعمل عليها التعلم العميق.
الشبكة العصبية هي تركيب من عمليات ضرب المصفوفات ودوال اللاخطية العنصرية. مسار الأمام يُطبِّق هذه الخرائط في تسلسل: z⁽ˡ⁾ = W⁽ˡ⁾a⁽ˡ⁻¹⁾ + b⁽ˡ⁾، وa⁽ˡ⁾ = σ(z⁽ˡ⁾). الانتشار للخلف يحسب التدرجات عبر قاعدة السلسلة، مُتكرِّراً إشارات الخطأ δ⁽ˡ⁾ للخلف عبر منقول مصفوفات الأوزان. التطبيع الدُفعي يُطبِّع ما قبل التنشيطات إلى وسط صفر وتباين وحدة داخل كل دُفعة صغيرة، باستخدام تحجيم γ وإزاحة β قابلَين للتعلم. آلية الانتباه تحسب تشابهات حاصل الضرب النقطي المُقيَّس بين الاستعلامات والمفاتيح، مُنتجةً مجاميع مُرجَّحة للقيم: Attention(Q,K,V) = softmax(QKᵀ/√dₖ)V. الانتباه متعدد الرؤوس يُشغِّل h عملية انتباه مستقلة بالتوازي، كل منها يتعلم أنواعاً مختلفة من العلاقات. المحوّلات تُكدِّس هذه المكوّنات مع الاتصالات المتبقية — مُمكِّنةً تدفق التدرج عبر مئات الطبقات — مما يجعل البنية كلها قابلة للتعبير كتسلسل من عمليات المصفوفات.