قراءة
وضع القصص

التقدير النقطي

~20 دقيقة قراءة الدرس 1 من 3 في الوحدة 5

مشكلة التقدير

في صميم الاستدلال الإحصائي تكمن تحدٍّ جوهري: نريد معرفة شيء عن مجتمع ما — متوسطه، تبايناته، احتمال حدث معين — لكننا لا نستطيع رؤيته إلا من خلال عينة محدودة. التقدير النقطي هو فن استخدام بيانات العينة لإنتاج تخمين واحد أفضل لمعامل مجهول في المجتمع.

قد يكون المعامل المجهول متوسط μ لتوزيع طبيعي، أو احتمال نجاح p لتجربة برنولي، أو معدل λ لعملية بواسون، أو أي كمية أخرى تصف كيفية توليد البيانات. لا يمكننا مشاهدة هذه المعاملات مباشرة؛ لا يمكننا إلا مشاهدة عواقبها المضوضاة في البيانات.

في هذا الدرس سنبني مفردات التقدير (المقدِّر مقابل التقدير، التحيز، الاتساق، الكفاءة)، ونطور إطارين منهجيين للتقدير (طريقة العزوم والإمكانية العظمى)، ونستكشف المقايضة الأساسية بين التحيز والتباين التي تحكم جميع مسائل التقدير.

المقدِّر مقابل التقدير

قبل كل شيء، نحتاج الدقة في اللغة. المقدِّر هو دالة في البيانات — قاعدة أو إجراء يحوّل عينة إلى عدد. التقدير هو القيمة المحددة التي ينتجها المقدِّر عند تطبيقه على مجموعة بيانات بعينها.

مثلاً، متوسط العينة X̄ = (X1 + X2 + … + Xn) / n هو مقدِّر لمتوسط المجتمع μ. إذا شاهدنا القيم المحددة {2.1, 3.4, 1.8, 4.0}، فإن x̄ = 2.825 هو التقدير — العدد المحدد الذي تنتجه هذه القاعدة على هذه البيانات.

المقدِّر متغير عشوائي: له توزيع (توزيع أخذ العينات) لأنه يعتمد على بيانات عشوائية. التقدير عدد ثابت، هو تحقق ذلك المتغير العشوائي. هذا التمييز بالغ الأهمية: حين نتحدث عن خصائص كالتحيز والتباين، نتحدث عن المقدِّر — سلوكه عبر جميع العينات الممكنة — لا عن أي تقدير منفرد.

التمييز الجوهري

المقدِّر: Θ̂ = g(X1, …, Xn) — دالة في متغيرات عشوائية، هو بذاته متغير عشوائي له توزيع.

التقدير: θ̂ = g(x1, …, xn) — العدد المحدد المحسوب من البيانات المشاهدة. الأحرف الصغيرة = مشاهد؛ الأحرف الكبيرة = متغير عشوائي.

اللاتحيز

أبسط الخصائص المرغوبة في المقدِّر وأكثرها حدسية هي اللاتحيز: في المتوسط، عبر جميع العينات الممكنة، يجب أن يساوي المقدِّر قيمة المعامل الحقيقي. رسمياً:

اللاتحيز
E[\hat{\theta}] = \theta \quad \text{for all } \theta
يكون المقدِّر غير متحيز إذا ساوى توقعه قيمة المعامل الحقيقي لجميع قيم θ الممكنة. التحيز يساوي صفراً: Bias(θ̂) = E[θ̂] − θ = 0.

متوسط العينة X̄ هو مقدِّر غير متحيز للمتوسط μ لأي مجتمع بمتوسط منتهٍ. تباين العينة S² = ∑(Xi − X̄)² / (n − 1) هو مقدِّر غير متحيز لـ σ² — القسمة على n − 1 بدلاً من n هو بالضبط ما يجعله غير متحيز.

لكن التحيز ليس فتّاكاً دائماً. بعض المقدِّرات متحيزة عمداً لتقليل التباين، مما يعطي أداءً أفضل بشكل عام. تباين العينة بالقسمة على n (مقدِّر الإمكانية العظمى لـ σ²) متحيز، لكنه بسيط وما زال مفيداً في سياقات كثيرة. يعتمد المعيار الصحيح على كيفية موازنتك بين التحيز والتباين.

الاتساق والكفاءة

الاتساق خاصية للعينات الكبيرة: يكون المقدِّر متسقاً إذا تقارب بالاحتمال نحو المعامل الحقيقي مع n → ∞. رسمياً، Θ̂n متسق لـ θ إذا كان لكل ε > 0:

الاتساق
\lim_{n\to\infty} P\!\left(|\hat{\theta}_n - \theta| > \varepsilon\right) = 0
مع تزايد حجم العينة، تتناهى إلى الصفر احتمالية أن يبتعد المقدِّر عن القيمة الحقيقية. المقدِّر المتسق «يتعلم» المعامل الحقيقي بالحصول على بيانات كافية.

يضمن قانون الأعداد الكبيرة اتساق متوسط العينة لأي مجتمع بمتوسط منتهٍ. بشكل أعم، أي مقدِّر غير متحيز يتناهى تبايناً إلى الصفر مع تزايد n يكون متسقاً.

الكفاءة تقارن المقدِّرات ضمن فئة المقدِّرات غير المتحيزة. المقدِّر غير المتحيز يكون كفؤاً إذا حقق أصغر تباين ممكن بين جميع المقدِّرات غير المتحيزة. يعطي حد كراميه-راو (CRLB) الحد النظري الأدنى للتباين الذي يمكن لأي مقدِّر غير متحيز بلوغه:

حد كراميه-راو
\text{Var}(\hat{\theta}) \geq \frac{1}{I(\theta)} = \frac{1}{E\!\left[\left(\frac{\partial}{\partial\theta}\log f(X;\theta)\right)^{\!2}\right]}
I(θ) هي معلومات فيشر — مقياس لمقدار ما تستطيع البيانات «إخبارنا» عن θ. كلما كانت I(θ) أكبر، كان التباين الممكن أصغر. المقدِّر الذي يبلغ هذا الحد يسمى UMVUE.

طريقة العزوم

طريقة العزوم (MOM) هي من أقدم أساليب التقدير وأكثرها حدسية. الفكرة بسيطة: العزم السكاني من الدرجة k هو E[Xk]، الذي يعتمد على المعامل المجهول θ. عزم العينة من الدرجة k هو mk = (1/n)∑Xik، المحسوب من البيانات. تساوي طريقة العزوم عزوم العينة بعزوم المجتمع وتحل معادلات للمعاملات.

للتوزيع ذي المعامل الواحد نستخدم العزم الأول. لمعاملين، نستخدم العزمين الأول والثاني، وهكذا. منظومة المعادلات هي:

طريقة العزوم
E[X^k] = m_k = \frac{1}{n}\sum_{i=1}^n X_i^k, \quad k = 1, \ldots, K
اضبط أول K عزوم سكانية مساوية لأول K عزوم للعينة، ثم حل للمعاملات الـ K المجهولة. يضمن قانون الأعداد الكبيرة الاتساق.

مثال — التوزيع الطبيعي: التوزيع N(μ, σ²) له E[X] = μ و E[X²] = σ² + μ². ضبط m1 = X̄ يعطي μ̂ = X̄، وحل من العزم الثاني يعطي σ̂² = (1/n)∑(Xi − X̄)². بسيط وحدسي.

طريقة العزوم سهلة التطبيق والمقدِّرات الناتجة متسقة. غير أنها قد لا تكون الأكثر كفاءة — فهي لا تستخدم جميع المعلومات في البيانات بأكثر الطرق فعالية. لهذا نلجأ إلى الإمكانية العظمى.

تقدير الإمكانية العظمى

تقدير الإمكانية العظمى (MLE) هو النموذج السائد في الإحصاء الحديث. الفكرة هي إيجاد قيمة المعامل التي تجعل البيانات المشاهدة أكثر احتمالاً — المعامل الذي تكون بموجبه البيانات «أكثر ترجيحاً».

بمشاهدات x1, …, xn من كثافة (أو دالة كتلة احتمالية) f(x; θ)، تعتبر دالة الإمكانية البيانات ثابتة وتنظر إلى f كدالة في θ:

دالة الإمكانية
L(\theta) = \prod_{i=1}^{n} f(x_i;\,\theta)
للمشاهدات المستقلة، تتحلل الكثافة المشتركة إلى ضرب. L(θ) هي الإمكانية — تجيب على: «كم كانت هذه البيانات محتملة، كدالة في θ؟»

لأن حواصل ضرب الأعداد الصغيرة الكثيرة إشكالية عددياً، نعمل دائماً تقريباً بـلوغاريتم الإمكانية ℓ(θ) = log L(θ). بما أن اللوغاريتم دالة متزايدة، فإن تعظيم ℓ وتعظيم L يعطيان الحل ذاته:

لوغاريتم الإمكانية
\ell(\theta) = \log L(\theta) = \sum_{i=1}^{n} \log f(x_i;\,\theta)
يحوّل اللوغاريتم الضرب إلى جمع — أسهل في الاشتقاق ومستقر عددياً. مقدِّر MLE هو θ̂ الذي يعظّم ℓ(θ).

لإيجاد MLE، اشتق لوغاريتم الإمكانية بالنسبة إلى θ وضع المشتقة مساوية للصفر. هذا يعطي معادلة الدرجة:

معادلة درجة MLE
\frac{\partial \ell(\theta)}{\partial \theta} = 0 \implies \hat{\theta}_{\text{MLE}}
الدرجة هي تدرج لوغاريتم الإمكانية. ضبطها مساوية للصفر يجد القيمة العظمى (تحقق أنها عظمى لا صغرى باستخدام المشتقة الثانية).

MLE للتوزيعات الشائعة

لنتعامل مع ثلاثة أمثلة هي الأهم، توضّح أسلوب MLE وتنتج نتائج ستستخدمها باستمرار.

التوزيع الطبيعي N(μ, σ²): لوغاريتم الإمكانية لـ n مشاهدة طبيعية مستقلة متماثلة التوزيع هو:

لوغاريتم إمكانية الطبيعي
\ell(\mu,\sigma^2) = -\dfrac{n}{2}\log(2\pi\sigma^2) - \dfrac{1}{2\sigma^2}\sum_{i=1}^n(x_i - \mu)^2
الاشتقاق بالنسبة لـ μ يعطي μ̂ = X̄. الاشتقاق بالنسبة لـ σ² يعطي σ̂² = (1/n)Σ(Xᵢ − X̄)². ملاحظة: MLE لـ σ² تستخدم المقسوم عليه n (متحيز قليلاً) بعكس S² ذات n−1 (غير متحيز).
MLE لبرنولي
\hat{p}_{\text{MLE}} = \bar{X} = \dfrac{\sum_{i=1}^n X_i}{n}
p̂ = X̄ = k/n، حيث k عدد النجاحات. نسبة العينة هي MLE.
MLE لبواسون
\hat{\lambda}_{\text{MLE}} = \bar{X} = \dfrac{\sum_{i=1}^n X_i}{n}
λ̂ = X̄. متوسط العينة هو MLE لمعدل بواسون. نفس طريقة العزوم.
لماذا MLE قوي

الاتساق: في ظل شروط انتظامية خفيفة، يتقارب المقدِّر θ̂ بالاحتمال نحو θ الحقيقي مع n → ∞.

الكفاءة المقاربية: يبلغ MLE حد كراميه-راو مقاربياً — لا يوجد مقدِّر متسق بتباين مقاربي أصغر.

الثبات: إذا كان θ̂ هو MLE لـ θ، فإن g(θ̂) هو MLE لـ g(θ) لأي دالة g. هذا يجعل التحويلات تافهة.

المقايضة بين التحيز والتباين

اللاتحيز والتباين الصغير كلاهما مرغوبان، لكنهما كثيراً ما يتعارضان. متوسط مربع الخطأ (MSE) يجمعهما في معيار واحد يقيس الدقة الكلية للمقدِّر:

تحليل MSE
\text{MSE}(\hat{\theta}) = E[(\hat{\theta}-\theta)^2] = \underbrace{\text{Var}(\hat{\theta})}_{\text{variance}} + \underbrace{[\text{Bias}(\hat{\theta})]^2}_{\text{bias}^2}
MSE = التباين + التحيز². يمكن لمقدِّر متحيز أن يكون أدنى MSE من مقدِّر غير متحيز إذا كان تبايناً أصغر بكثير. هذا التحليل هو مقايضة التحيز-التباين.

فكر في تقدير التباين الطبيعي σ². المقدِّر σ̂² = (1/n)∑(Xi − X̄)² متحيز (E[σ̂²] = ((n-1)/n)σ²)، لكنه أقل تبايناً من S² = (1/(n-1))∑(Xi − X̄)² غير المتحيز. لصغير n، هذه التبادل قد تكون مجدية؛ لكبير n، يكون كلا المقدِّرين متشابهين تقريباً.

مقايضة التحيز-التباين ليست مجرد فضول — إنها التوتر المحوري في كل الإحصاء والتعلم الآلي. التحجيم (Ridge، Lasso) يُدخل التحيز عمداً لتقليل التباين. مقدِّرات الانكماش (مثل مقدِّر جيمس-شتاين) تنكمش عمداً نحو الصفر أو قيمة مسبقة ما، مقايضةً اللاتحيز بانخفاض MSE في الأبعاد العالية.

الحدس: سهام على لوحة

غير متحيز، تباين عالٍ: سهام مركزها مركز اللوحة لكنها مبعثرة. صحيح في المتوسط، لكن لا سهم واحد قريب.

متحيز، تباين منخفض: سهام متجمعة بإحكام لكنها بعيدة عن المركز. خاطئ باستمرار بنفس الاتجاه، لكن دقيق.

غير متحيز، تباين منخفض: المثالي — مركزها المركز ومتجمعة بإحكام. ممكن فقط إذا وجد مقدِّر كفء غير متحيز (UMVUE).

النقاط الرئيسية
  • المقدِّر مقابل التقدير: المقدِّر Θ̂ = g(X1,…,Xn) متغير عشوائي (قاعدة)؛ التقدير θ̂ = g(x1,…,xn) هو العدد المحدد الذي ينتجه على البيانات المشاهدة.
  • اللاتحيز: E[Θ̂] = θ لكل θ. متوسط العينة غير متحيز لـ μ؛ تباين العينة بـ n−1 غير متحيز لـ σ².
  • الاتساق: Θ̂n → θ بالاحتمال مع n → ∞. أي مقدِّر غير متحيز بتباين → 0 يكون متسقاً.
  • الكفاءة: يعطي حد كراميه-راو أدنى تباين يمكن لأي مقدِّر غير متحيز بلوغه. MLE كفء مقاربياً.
  • طريقة العزوم: اضبط عزوم العينة مساوية لعزوم المجتمع وحل. بسيط ومتسق لكن ليس الأكثر كفاءة دائماً.
  • MLE: اختر θ الذي يعظّم L(θ) = ∏f(xi;θ)، أو ما يكافئه ℓ(θ) = ∑log f(xi;θ). مقدِّرات MLE متسقة، كفؤة مقاربياً، وثابتة تحت إعادة التحجيم.
  • مقايضة التحيز-التباين: MSE = التباين + التحيز². إدخال التحيز يمكن أن يخفض MSE إذا أنقص التباين بشكل كافٍ. هذا التوتر محوري في الإحصاء والتعلم الآلي.
السابق نظرية النهاية المركزية نظرة عامة على الوحدة التالي فترات الثقة