الرئيسية / LA 101 / الوحدة 11 / الدرس 2
وضع القصص

تحليل المصفوفة

مصفوفات البيانات الكبيرة تخفي بنية لا يكشفها أي عنصر منفرد. تحليل المصفوفة — NMF والتصفية التعاونية بـ SVD والتحليل الدلالي الكامن — يتعلّم تلك البنية المخفية بتحليل المصفوفة إلى حاصل ضرب قطع أبسط وأكثر قابلية للتفسير.

~13 دقيقة قراءة الوحدة 11 · الدرس 2 متوسط

لماذا نُحلِّل المصفوفة؟

لنفكّر في مصفوفة V بأبعاد m×n — ربما تقييمات أعطاها m مستخدم لـ n فيلم، أو أعداد كلمات في m وثيقة عبر مفردات من n كلمة. معظم المدخلات قد تكون مفقودة أو صفراً. المصفوفة الخام صعبة التفسير: تحتوي mn رقماً دون بنية واضحة.

يُحلِّل تحليل المصفوفة V إلى حاصل ضرب مصفوفتين أصغر (أو أكثر) تتوافق أعمدتها وصفوفها مع العوامل الكامنة — المفاهيم الخفية التي تُفسّر البيانات المُلاحَظة. الفكرة تظهر عبر تعلم الآلة بأسماء متعددة: NMF للتمثيلات القائمة على الأجزاء، SVD لأنظمة التوصية، LSA للنصوص، والتحليل الضمني في التضمينات اللفظية. كلها تشترك في نفس الجبر الخطي الأساسي.

تحليل المصفوفة غير السالبة (NMF)

بناءً على مصفوفة غير سالبة V ∈ ℝ₊^{m×n}، يبحث NMF عن مصفوفتي عوامل غير سالبتين W ∈ ℝ₊^{m×k} و H ∈ ℝ₊^{k×n} بحيث V ≈ WH، حيث k ≪ min(m,n) هو عدد المكوّنات الكامنة:

هدف NMF
\min_{W \geq 0,\, H \geq 0} \|V - WH\|_F^2
معيار فروبينيوس ‖·‖_F يقيس خطأ إعادة البناء عنصراً بعنصر. قيود عدم السالبية (W ≥ 0, H ≥ 0) تُجبر على تحليل قائم على الإضافة والأجزاء — كل عمود من W هو "جزء" وكل صف من H يخبر مدى حضور كل جزء في كل نقطة بيانات. أعمدة W تُشكّل قاموساً فائق الاكتمال؛ كل نقطة بيانات هي تركيب غير سالب من ذرات القاموس.

بسبب عدم السالبية، ينتج NMF تلقائياً عوامل قابلة للتفسير. لمجموعة صور الوجوه، أعمدة W تشبه الملامح — عيون وأنوف وأفواه — وH تُشفِّر مدى حضور كل ملمح في كل صورة. للنصوص، أعمدة W هي توزيعات كلمات الموضوعات وصفوف H هي أوزان الوثيقة لكل موضوع.

يُحلّ NMF بتحديثات ضربية متناوبة مشتقة من تدرج هدف فروبينيوس. ابتداءً من W وH عشوائيتين غير سالبتين:

قواعد التحديث الضربي
H \leftarrow H \odot \frac{W^T V}{W^T W H}, \quad W \leftarrow W \odot \frac{V H^T}{W H H^T}
كل تحديث عنصري: اضرب في نسبة التدرج الموجب إلى التدرج السالب. هذا يضمن بقاء W وH غير سالبتين طوال العملية. تتقارب التحديثات نحو حد أدنى محلي — NMF غير محدب في (W,H) معاً، وإن كان محدباً في كل عامل منفرداً.
تمثيلات الأجزاء مقابل التمثيلات الشاملة

يسمح PCA (عبر SVD) بمعاملات سالبة، لذا مكوّناته يمكن أن تتلاشى — تمثيل شامل. عدم سالبية NMF يعني أن المكوّنات تُضاف فقط دون طرح، منتجةً تمثيلات قائمة على الأجزاء تتوافق مع طريقة وصف الإنسان للأشياء. هذا يجعل عوامل NMF أكثر قابلية للتفسير في مجالات كالصور والنصوص والأطياف الصوتية.

التصفية التعاونية عبر SVD

يجب على نظام التوصية التنبؤ بما إذا كان المستخدم i سيُحبّ العنصر j، مع إعطاء مصفوفة متفرقة من التقييمات المُلاحَظة R ∈ ℝ^{m×n} فقط. الرؤية الأساسية من التصفية التعاونية هي أن التقييمات منخفضة الرتبة: عدد صغير من العوامل الكامنة (الأنواع والأساليب والموضوعات) يُفسّر معظم التباين عبر ملايين التقييمات.

يُحلِّل SVD مصفوفة R = UΣVᵀ حيث تحتوي U ∈ ℝ^{m×r} متجهات المستخدمين الكامنة، وΣ مصفوفة قطرية من القيم الأحادية، وV ∈ ℝ^{n×r} متجهات العناصر الكامنة. عملياً لـ R مدخلات مفقودة كثيرة فلا يمكن حساب SVD الدقيق. بدلاً من ذلك نُصغِّر خسارة إعادة بناء منظَّمة على التقييمات المُلاحَظة فقط:

تحليل المصفوفة لأنظمة التوصية
\min_{\{p_i\},\{q_j\}} \sum_{(i,j)\in\Omega} (r_{ij} - p_i^T q_j)^2 + \lambda(\|p_i\|^2 + \|q_j\|^2)
Ω هو مجموعة الأزواج (i,j) المُلاحَظة، pᵢ ∈ ℝᵏ هو المتجه الكامن للمستخدم i، qⱼ ∈ ℝᵏ هو المتجه الكامن للعنصر j، وλ يتحكم في قوة التنظيم. التقييم المتنبَّأ به هو r̂ᵢⱼ = pᵢᵀqⱼ. يُتعلَّم بالانحدار التدرجي العشوائي: لكل تقييم مُلاحَظ، حدِّث pᵢ وqⱼ لتقليل البواقي (rᵢⱼ − pᵢᵀqⱼ).

بعد التدريب، تُشفِّر المتجهات k-الأبعاد pᵢ وqⱼ تفضيلات المستخدم وخصائص العنصر في فضاء كامن مشترك. العناصر ذات متجهات qⱼ المتشابهة متشابهة (حتى لو لم تشترك في ميزات صريحة)، والمستخدمون ذوو متجهات pᵢ المتشابهة لهم أذواق متشابهة. الضرب الداخلي pᵢᵀqⱼ يقيس التوافق بين تفضيل المستخدم وطابع العنصر.

التقريب منخفض الرتبة ومبرهنة إيكارت-يونغ

تُؤسِّس مبرهنة إيكارت-يونغ أن أفضل تقريب رتبة-k لمصفوفة A (في كلا المعيار الطيفي ومعيار فروبينيوس) يُحصَل عليه بقطع SVD الخاص بها: الإبقاء فقط على k أكبر قيمة أحادية ومتجهاتها الأحادية المقابلة. إذا كان A = UΣVᵀ، فإن:

SVD المقطوع (أفضل تقريب رتبة-k)
A_k = U_k \Sigma_k V_k^T = \sum_{i=1}^{k} \sigma_i \mathbf{u}_i \mathbf{v}_i^T
Aₖ = UₖΣₖVₖᵀ، حيث تحتوي Uₖ وVₖ فقط على أول k عمود. خطأ التقريب هو ‖A − Aₖ‖_F² = σₖ₊₁² + σₖ₊₂² + … + σᵣ². نسبة التباين الموضَّح بأفضل k مكوّن هي (σ₁² + … + σₖ²) / (σ₁² + … + σᵣ²). رسم بياني للقيم الأحادية المربعة يساعد في تحديد k عند "المِرفق" حيث يُضيف كل مكوّن إضافي تباين ضئيل.

التحليل الدلالي الكامن (LSA)

يُطبِّق LSA التحليل SVD المقطوع على مصفوفة المصطلح-الوثيقة. نبني مصفوفة A ∈ ℝ^{t×d} حيث Aᵢⱼ هو وزن TF-IDF لعدد مرات ظهور المصطلح i في الوثيقة j. يُحلِّل SVD مصفوفة A = UΣVᵀ؛ القطع إلى رتبة k يعطي تمثيلاً مضغوطاً Aₖ = UₖΣₖVₖᵀ.

صفوف UₖΣₖ هي "متجهات المفاهيم" لكل مصطلح، وأعمدة ΣₖVₖᵀ هي متجهات المفاهيم لكل وثيقة — كلاهما يعيش في نفس الفضاء الدلالي الكامن k-الأبعاد. تُقاس مشابهة الوثائق بتشابه جيب التمام بين متجهات مفاهيمها، مما يلتقط الترادف (الكلمات ذات المعنى الواحد تتجمع) وتعدد المعاني (الكلمات ذات المعاني المتعددة تتموضع قرب معناها الأكثر شيوعاً).

لماذا يُزيل SVD ضوضاء النصوص

مصفوفة المصطلح-الوثيقة الخام مشوَّشة: المترادفات تظهر كأبعاد مختلفة، التزامنات غير ذات صلة تُضخِّم التشابه. القطع إلى رتبة k يُزيل أبعاد الضوضاء (تلك ذات القيم الأحادية الصغيرة) ويحتفظ بالاتجاهات الدلالية السائدة. الوثائق التي تشترك في موضوعات دون مفردات دقيقة تنتهي قريبة في الفضاء منخفض الرتبة.

التضمينات اللفظية وتحليل المصفوفة

Word2Vec (skip-gram مع أخذ عينات سالبة) وGloVe — طرق التضمين اللفظي السائدة — لها صلات عميقة بتحليل المصفوفة. يُحلِّل GloVe بشكل صريح مصفوفة لوغاريتم التزامن: بناءً على مصفوفة عدد التزامن X حيث Xᵢⱼ يعدّ عدد مرات ظهور الكلمة i بالقرب من الكلمة j في مجموعة نصوص كبيرة، يبحث GloVe عن متجهات الكلمات wᵢ ومتجهات السياق w̃ⱼ بحيث:

هدف GloVe
\min_{w_i, \tilde{w}_j, b_i, \tilde{b}_j} \sum_{i,j} f(X_{ij})\,(w_i^T \tilde{w}_j + b_i + \tilde{b}_j - \log X_{ij})^2
f(Xᵢⱼ) دالة ترجيح تُقلِّل وزن التزامنات الشائعة جداً. التحيزات bᵢ وb̃ⱼ تمتص تأثيرات تردد الكلمة المحددة. النتيجة: wᵢᵀw̃ⱼ ≈ log Xᵢⱼ. هذا بالضبط تقريب مُرجَّح منخفض الرتبة لمصفوفة لوغاريتم التزامن. المتجهات المُتعلَّمة تلتقط القياسات الدلالية: ملك − رجل + امرأة ≈ ملكة في فضاء التضمين.

أثبت Levy وGoldberg (2014) أن Word2Vec skip-gram مع أخذ العينات السالبة يُحلِّل ضمنياً مصفوفة معلومات الانتماء النقطي المُزاحة (PMI) — نسخة مُرجَّحة من مصفوفة لوغاريتم التزامن. الصلة تُظهر أن التضمينات اللفظية العصبية ليست مختلفة جوهرياً عن تحليل المصفوفة الكلاسيكي؛ تختلف أساساً في استراتيجيات التحسين والترجيح.

الخصائص الهندسية للتضمينات

البنية الهندسية لفضاءات تضمين الكلمات تتبع مباشرةً من هدف تحليل المصفوفة. إذا كان wᵢᵀw̃ⱼ ≈ log P(j|i)، فإن:

اختيار الرتبة: اختيار النموذج

جميع طرق تحليل المصفوفة تتطلب اختيار k، عدد العوامل الكامنة. صغير جداً: النموذج يُفرِط في التبسيط. كبير جداً: النموذج يُفرِط في التكيّف مع الضوضاء وتفقد العوامل قابلية تفسيرها.

الاستراتيجيات العملية:


النقاط الرئيسية

يُحلِّل تحليل المصفوفة مصفوفة بيانات V ≈ WH إلى مصفوفتي عوامل كامنة، كاشفاً عن بنية خفية في البيانات عالية الأبعاد. يُطبِّق NMF عدم السالبية لإنتاج تحليلات قائمة على الأجزاء وقابلة للتفسير. التصفية التعاونية عبر SVD تُمثِّل المستخدمين والعناصر كمتجهات كامنة في فضاء مشترك؛ التقييمات المتنبأ بها هي حواصل ضرب pᵢᵀqⱼ. مبرهنة إيكارت-يونغ تضمن أن SVD المقطوع هو التقريب الأمثل منخفض الرتبة. LSA يُطبِّق هذا على النصوص لاكتشاف الموضوعات الدلالية الكامنة. تضمينات الكلمات (GloVe وWord2Vec) تُحلِّل ضمنياً مصفوفات لوغاريتم التزامن، منتجةً فضاءات متجهية حيث تتوافق العلاقات الدلالية مع الاتجاهات الهندسية.