لماذا نُحلِّل المصفوفة؟
لنفكّر في مصفوفة V بأبعاد m×n — ربما تقييمات أعطاها m مستخدم لـ n فيلم، أو أعداد كلمات في m وثيقة عبر مفردات من n كلمة. معظم المدخلات قد تكون مفقودة أو صفراً. المصفوفة الخام صعبة التفسير: تحتوي mn رقماً دون بنية واضحة.
يُحلِّل تحليل المصفوفة V إلى حاصل ضرب مصفوفتين أصغر (أو أكثر) تتوافق أعمدتها وصفوفها مع العوامل الكامنة — المفاهيم الخفية التي تُفسّر البيانات المُلاحَظة. الفكرة تظهر عبر تعلم الآلة بأسماء متعددة: NMF للتمثيلات القائمة على الأجزاء، SVD لأنظمة التوصية، LSA للنصوص، والتحليل الضمني في التضمينات اللفظية. كلها تشترك في نفس الجبر الخطي الأساسي.
تحليل المصفوفة غير السالبة (NMF)
بناءً على مصفوفة غير سالبة V ∈ ℝ₊^{m×n}، يبحث NMF عن مصفوفتي عوامل غير سالبتين W ∈ ℝ₊^{m×k} و H ∈ ℝ₊^{k×n} بحيث V ≈ WH، حيث k ≪ min(m,n) هو عدد المكوّنات الكامنة:
بسبب عدم السالبية، ينتج NMF تلقائياً عوامل قابلة للتفسير. لمجموعة صور الوجوه، أعمدة W تشبه الملامح — عيون وأنوف وأفواه — وH تُشفِّر مدى حضور كل ملمح في كل صورة. للنصوص، أعمدة W هي توزيعات كلمات الموضوعات وصفوف H هي أوزان الوثيقة لكل موضوع.
يُحلّ NMF بتحديثات ضربية متناوبة مشتقة من تدرج هدف فروبينيوس. ابتداءً من W وH عشوائيتين غير سالبتين:
يسمح PCA (عبر SVD) بمعاملات سالبة، لذا مكوّناته يمكن أن تتلاشى — تمثيل شامل. عدم سالبية NMF يعني أن المكوّنات تُضاف فقط دون طرح، منتجةً تمثيلات قائمة على الأجزاء تتوافق مع طريقة وصف الإنسان للأشياء. هذا يجعل عوامل NMF أكثر قابلية للتفسير في مجالات كالصور والنصوص والأطياف الصوتية.
التصفية التعاونية عبر SVD
يجب على نظام التوصية التنبؤ بما إذا كان المستخدم i سيُحبّ العنصر j، مع إعطاء مصفوفة متفرقة من التقييمات المُلاحَظة R ∈ ℝ^{m×n} فقط. الرؤية الأساسية من التصفية التعاونية هي أن التقييمات منخفضة الرتبة: عدد صغير من العوامل الكامنة (الأنواع والأساليب والموضوعات) يُفسّر معظم التباين عبر ملايين التقييمات.
يُحلِّل SVD مصفوفة R = UΣVᵀ حيث تحتوي U ∈ ℝ^{m×r} متجهات المستخدمين الكامنة، وΣ مصفوفة قطرية من القيم الأحادية، وV ∈ ℝ^{n×r} متجهات العناصر الكامنة. عملياً لـ R مدخلات مفقودة كثيرة فلا يمكن حساب SVD الدقيق. بدلاً من ذلك نُصغِّر خسارة إعادة بناء منظَّمة على التقييمات المُلاحَظة فقط:
بعد التدريب، تُشفِّر المتجهات k-الأبعاد pᵢ وqⱼ تفضيلات المستخدم وخصائص العنصر في فضاء كامن مشترك. العناصر ذات متجهات qⱼ المتشابهة متشابهة (حتى لو لم تشترك في ميزات صريحة)، والمستخدمون ذوو متجهات pᵢ المتشابهة لهم أذواق متشابهة. الضرب الداخلي pᵢᵀqⱼ يقيس التوافق بين تفضيل المستخدم وطابع العنصر.
التقريب منخفض الرتبة ومبرهنة إيكارت-يونغ
تُؤسِّس مبرهنة إيكارت-يونغ أن أفضل تقريب رتبة-k لمصفوفة A (في كلا المعيار الطيفي ومعيار فروبينيوس) يُحصَل عليه بقطع SVD الخاص بها: الإبقاء فقط على k أكبر قيمة أحادية ومتجهاتها الأحادية المقابلة. إذا كان A = UΣVᵀ، فإن:
التحليل الدلالي الكامن (LSA)
يُطبِّق LSA التحليل SVD المقطوع على مصفوفة المصطلح-الوثيقة. نبني مصفوفة A ∈ ℝ^{t×d} حيث Aᵢⱼ هو وزن TF-IDF لعدد مرات ظهور المصطلح i في الوثيقة j. يُحلِّل SVD مصفوفة A = UΣVᵀ؛ القطع إلى رتبة k يعطي تمثيلاً مضغوطاً Aₖ = UₖΣₖVₖᵀ.
صفوف UₖΣₖ هي "متجهات المفاهيم" لكل مصطلح، وأعمدة ΣₖVₖᵀ هي متجهات المفاهيم لكل وثيقة — كلاهما يعيش في نفس الفضاء الدلالي الكامن k-الأبعاد. تُقاس مشابهة الوثائق بتشابه جيب التمام بين متجهات مفاهيمها، مما يلتقط الترادف (الكلمات ذات المعنى الواحد تتجمع) وتعدد المعاني (الكلمات ذات المعاني المتعددة تتموضع قرب معناها الأكثر شيوعاً).
مصفوفة المصطلح-الوثيقة الخام مشوَّشة: المترادفات تظهر كأبعاد مختلفة، التزامنات غير ذات صلة تُضخِّم التشابه. القطع إلى رتبة k يُزيل أبعاد الضوضاء (تلك ذات القيم الأحادية الصغيرة) ويحتفظ بالاتجاهات الدلالية السائدة. الوثائق التي تشترك في موضوعات دون مفردات دقيقة تنتهي قريبة في الفضاء منخفض الرتبة.
التضمينات اللفظية وتحليل المصفوفة
Word2Vec (skip-gram مع أخذ عينات سالبة) وGloVe — طرق التضمين اللفظي السائدة — لها صلات عميقة بتحليل المصفوفة. يُحلِّل GloVe بشكل صريح مصفوفة لوغاريتم التزامن: بناءً على مصفوفة عدد التزامن X حيث Xᵢⱼ يعدّ عدد مرات ظهور الكلمة i بالقرب من الكلمة j في مجموعة نصوص كبيرة، يبحث GloVe عن متجهات الكلمات wᵢ ومتجهات السياق w̃ⱼ بحيث:
أثبت Levy وGoldberg (2014) أن Word2Vec skip-gram مع أخذ العينات السالبة يُحلِّل ضمنياً مصفوفة معلومات الانتماء النقطي المُزاحة (PMI) — نسخة مُرجَّحة من مصفوفة لوغاريتم التزامن. الصلة تُظهر أن التضمينات اللفظية العصبية ليست مختلفة جوهرياً عن تحليل المصفوفة الكلاسيكي؛ تختلف أساساً في استراتيجيات التحسين والترجيح.
الخصائص الهندسية للتضمينات
البنية الهندسية لفضاءات تضمين الكلمات تتبع مباشرةً من هدف تحليل المصفوفة. إذا كان wᵢᵀw̃ⱼ ≈ log P(j|i)، فإن:
- الترادف: الكلمات التي تظهر في سياقات مماثلة لها متجهات مماثلة — ضرباتها الداخلية مع جميع كلمات السياق متشابهة
- القياس: متجه الفرق wملك − wرجل يلتقط اتجاه "الملكية"؛ إضافته إلى wامرأة تُحرّك نحو wملكة
- التركيبية: معنى العبارة هو تقريباً مجموع متجهات الكلمات — تقريب جمعي لحاصل ضرب PMI
اختيار الرتبة: اختيار النموذج
جميع طرق تحليل المصفوفة تتطلب اختيار k، عدد العوامل الكامنة. صغير جداً: النموذج يُفرِط في التبسيط. كبير جداً: النموذج يُفرِط في التكيّف مع الضوضاء وتفقد العوامل قابلية تفسيرها.
الاستراتيجيات العملية:
- الرسم البياني للانكسار (SVD/PCA): ارسم σᵢ² مقابل i؛ ابحث عن "المِرفق" حيث يتسطّح المنحنى
- التباين الموضَّح: اختر k بحيث تُفسِّر أعلى k قيم أحادية 90-95% من التباين الكلي
- التحقق المتقاطع (أنظمة التوصية): احتفظ بمجموعة عشوائية من التقييمات؛ اختر k الذي يُصغِّر RMSE التحقق
- خطأ إعادة البناء مقابل قابلية التفسير (NMF): k الأصغر يعطي عوامل أكثر قابلية للتفسير لكن أقل دقة
يُحلِّل تحليل المصفوفة مصفوفة بيانات V ≈ WH إلى مصفوفتي عوامل كامنة، كاشفاً عن بنية خفية في البيانات عالية الأبعاد. يُطبِّق NMF عدم السالبية لإنتاج تحليلات قائمة على الأجزاء وقابلة للتفسير. التصفية التعاونية عبر SVD تُمثِّل المستخدمين والعناصر كمتجهات كامنة في فضاء مشترك؛ التقييمات المتنبأ بها هي حواصل ضرب pᵢᵀqⱼ. مبرهنة إيكارت-يونغ تضمن أن SVD المقطوع هو التقريب الأمثل منخفض الرتبة. LSA يُطبِّق هذا على النصوص لاكتشاف الموضوعات الدلالية الكامنة. تضمينات الكلمات (GloVe وWord2Vec) تُحلِّل ضمنياً مصفوفات لوغاريتم التزامن، منتجةً فضاءات متجهية حيث تتوافق العلاقات الدلالية مع الاتجاهات الهندسية.