قراءة
وضع القصص

أنواع البيانات

~١٢ دقيقة قراءة الدرس ٢ من ٥ في الوحدة ١

لماذا تهم أنواع البيانات

ليست كل البيانات متساوية. نوع البيانات الذي تجمعه يحدد الأساليب الإحصائية التي يمكنك استخدامها، والرسوم البيانية المناسبة، والاستنتاجات التي يمكنك استخلاصها. اختيار الأسلوب الخاطئ لنوع بياناتك هو أحد أكثر الأخطاء شيوعًا في الإحصاء — وقد يؤدي إلى نتائج غير صحيحة تمامًا.

تشكل أنواع البيانات تسلسلًا هرميًا، من أبسط الفئات إلى أغنى القياسات. فهم هذا التسلسل هو الخطوة الأولى الأساسية في أي تحليل إحصائي. قبل أن تحسب رقمًا واحدًا أو ترسم مخططًا واحدًا، يجب أن تسأل: ما نوع البيانات التي أعمل بها؟

القاعدة الذهبية

نوع البيانات يحدد التحليل. لا يمكنك حساب متوسط ذي معنى لفصائل الدم. ولا يمكنك ترتيب درجات الحرارة المئوية كنسب. كل أداة إحصائية لها افتراضات حول نوع البيانات — انتهاكها ينتج نتائج بلا معنى.

نوع البيانات ← العمليات الصالحة ← التحليل الصحيح

النوعية مقابل الكمية

أوسع تقسيم في البيانات هو بين البيانات النوعية (الفئوية) والبيانات الكمية (العددية). البيانات النوعية تصف صفات أو فئات — أشياء مثل الألوان والأسماء والتصنيفات. البيانات الكمية تمثل كميات — أشياء يمكنك عدها أو قياسها بالأرقام.

البيانات النوعية تجيب عن أي نوع؟ أو أي فئة؟ البيانات الكمية تجيب عن كم؟ أو كم عدد؟ هذا التمييز جوهري لأن مجموعة أدوات التحليل الإحصائي بأكملها تتفرع بناءً عليه. تلخص البيانات الفئوية بالتكرارات والنسب؛ وتلخص البيانات العددية بالمتوسطات والانحرافات المعيارية.

البيانات الاسمية

البيانات الاسمية هي أبسط أنواع البيانات. تتكون من فئات بدون ترتيب متأصل. كلمة «اسمية» مشتقة من الكلمة اللاتينية nomen بمعنى «اسم» — وهذا بالضبط ما تفعله البيانات الاسمية: تسمي الأشياء أو تصنفها.

تشمل الأمثلة فصائل الدم (A، B، AB، O)، وألوان العيون (بني، أزرق، أخضر)، والجنس، والجنسية، والحالة الاجتماعية. يمكنك عد العناصر في كل فئة وحساب النسب، لكن لا يمكنك ترتيب هذه الفئات أو حساب متوسط ذي معنى. القول بأن «متوسط فصيلة الدم هو B+» لا معنى له.

نسبة البيانات الاسمية
\hat{p}_k = \frac{n_k}{N}
نسبة المشاهدات في الفئة k — الملخص العددي الوحيد ذو المعنى للبيانات الاسمية

البيانات الترتيبية

البيانات الترتيبية لها فئات ذات ترتيب طبيعي ذي معنى، لكن المسافات بين الفئات ليست بالضرورة متساوية. فكر في تقييمات رضا العملاء: «غير راضٍ جدًا»، «غير راضٍ»، «محايد»، «راضٍ»، «راضٍ جدًا». هناك ترتيب واضح، لكن الفجوة بين «محايد» و«راضٍ» قد لا تساوي الفجوة بين «راضٍ» و«راضٍ جدًا».

أمثلة أخرى تشمل المستويات التعليمية (ثانوية، بكالوريوس، ماجستير، دكتوراه)، والرتب العسكرية، ومقاييس الألم (١–١٠)، والوضع الاقتصادي الاجتماعي (منخفض، متوسط، مرتفع). يمكنك القول أن فئة ما «أعلى» أو «أفضل» من أخرى، لكن لا يمكنك تحديد بكم. الوسيط والمئينات مناسبان؛ أما المتوسطات فمحل جدل.

البيانات الفترية

البيانات الفترية لها تباعد متساوٍ بين القيم، لكن بدون نقطة صفر حقيقية. المثال الكلاسيكي هو درجة الحرارة بالدرجة المئوية أو الفهرنهايت. الفرق بين ٢٠ و٣٠ درجة مئوية هو نفسه بين ٣٠ و٤٠ درجة مئوية — كلاهما فجوة ١٠ درجات. لكن ٠ درجة مئوية لا تعني «لا حرارة». إنها نقطة مرجعية اعتباطية (نقطة تجمد الماء).

بما أنه لا يوجد صفر حقيقي، فإن النسب لا معنى لها في البيانات الفترية. لا يمكنك القول أن ٤٠ درجة مئوية هي «ضعف حرارة» ٢٠ درجة مئوية. أمثلة أخرى تشمل التواريخ التقويمية (السنة صفر اعتباطية)، ودرجات معدل الذكاء، ودرجات الاختبارات المعيارية. يمكنك حساب المتوسطات والانحرافات المعيارية، لكن الضرب والقسمة على القيم يفتقران إلى التفسير.

البيانات النسبية

البيانات النسبية هي أغنى مقياس قياس. لها فترات متساوية و نقطة صفر حقيقية تمثل الغياب التام للكمية. تشمل الأمثلة الوزن (٠ كجم يعني لا وزن)، والطول، والمسافة، والدخل، والعمر، والمدة الزمنية.

مع البيانات النسبية، جميع العمليات الرياضية صالحة. يمكنك القول أن من يكسب ٨٠,٠٠٠ دولار يكسب ضعف من يكسب ٤٠,٠٠٠ دولار — هذه النسبة ذات معنى لأن ٠ دولار تعني حقًا «لا دخل». درجة الحرارة بالكلفن (حيث ٠ كلفن هو الصفر المطلق) هي بيانات نسبية، رغم أن المئوية والفهرنهايت ليستا كذلك.

خاصية النسبة
\frac{x_a}{x_b} \text{ is meaningful} \iff \text{true zero exists}
النسب ذات معنى فقط عند وجود صفر حقيقي — وهذا ما يميز البيانات النسبية عن الفترية
ملخص مقاييس القياس
المقياس ترتيب تباعد متساوٍ صفر حقيقي مثال
اسمي لا لا لا فصيلة الدم، لون العين
ترتيبي نعم لا لا تقييم الرضا
فتري نعم نعم لا الحرارة (°م)
نسبي نعم نعم نعم الوزن، الدخل

المنفصلة مقابل المتصلة

ضمن البيانات الكمية، هناك تمييز مهم آخر: المنفصلة مقابل المتصلة. البيانات المنفصلة لا يمكن أن تأخذ إلا قيمًا محددة قابلة للعد — عدد الطلاب في الفصل (يمكن أن يكون ٢٥ أو ٢٦، لكن ليس ٢٥.٧)، عدد العناصر المعيبة في دفعة، أو عدد زيارات الموقع.

البيانات المتصلة يمكن أن تأخذ أي قيمة ضمن نطاق، بما في ذلك الكسور والأرقام العشرية. الطول والوزن والوقت ودرجة الحرارة كلها بيانات متصلة — يمكن أن يكون طول شخص ١٧٠.٣ سم، أو يستغرق تفاعل ٣.٨٤٧ ثانية. هذا التمييز مهم لأن البيانات المنفصلة والمتصلة تتطلب توزيعات احتمالية مختلفة وتقنيات عرض مرئي مختلفة.

المهيكلة مقابل غير المهيكلة

في مشهد البيانات الحديث، نميز أيضًا بين البيانات المهيكلة وغير المهيكلة. البيانات المهيكلة تنتظم بدقة في جداول ذات صفوف وأعمدة — جداول البيانات وقواعد البيانات وملفات CSV. كل عمود له نوع بيانات محدد، وكل صف يتبع نفس التنسيق.

البيانات غير المهيكلة ليس لها تنسيق محدد مسبقًا. تشمل المستندات النصية والصور والتسجيلات الصوتية والفيديو ومنشورات وسائل التواصل الاجتماعي وتدفقات أجهزة الاستشعار. تشير التقديرات إلى أن ٨٠–٩٠٪ من بيانات العالم غير مهيكلة. يتطلب معالجتها تقنيات متخصصة مثل معالجة اللغة الطبيعية والرؤية الحاسوبية قبل أن يمكن تطبيق الأساليب الإحصائية التقليدية.

طرق جمع البيانات

كيفية جمع البيانات لا تقل أهمية عن نوعها. الطرق الثلاث الرئيسية هي الاستطلاعات والتجارب والدراسات الرصدية.

الاستطلاعات تجمع بيانات ذاتية التقرير من خلال استبيانات أو مقابلات. هي فعالة لجمع كميات كبيرة من البيانات لكنها عرضة لتحيز الاستجابة — قد لا يجيب الناس بصدق أو قد يفسرون الأسئلة بشكل مختلف.

التجارب هي المعيار الذهبي لإثبات العلاقة السببية. يتحكم الباحث بشكل فعال في متغير واحد (المعالجة) ويقيس تأثيره على متغير آخر، مع ضبط كل شيء آخر. التجارب المعشاة المضبوطة في الطب هي المثال الكلاسيكي.

الدراسات الرصدية تجمع البيانات دون تدخل. يراقب الباحث ويسجل ما يحدث طبيعيًا. يمكنها الكشف عن ارتباطات وعلاقات لكنها لا تستطيع إثبات السببية — وهذا أحد أهم المبادئ في الإحصاء.

الارتباط مقابل السببية
r_{xy} = \frac{\sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum_{i=1}^{n}(x_i - \bar{x})^2 \cdot \sum_{i=1}^{n}(y_i - \bar{y})^2}}
الارتباط يقيس العلاقة الخطية بين متغيرين — لكن الارتباط لا يعني السببية

اختيار الأسلوب المناسب

نوع البيانات الذي لديك يحدد مباشرة الأساليب الإحصائية المناسبة. للبيانات الاسمية، استخدم جداول التكرار والمخططات الشريطية واختبارات كاي تربيع. للبيانات الترتيبية، استخدم الوسيط والمئينات والاختبارات اللامعلمية مثل اختبار مان-ويتني. للبيانات الفترية والنسبية، لديك الترسانة الكاملة: المتوسطات والانحرافات المعيارية واختبارات t وتحليل التباين والانحدار والارتباط.

عدم التطابق بين أنواع البيانات والأساليب يؤدي إلى نتائج بلا معنى. حساب متوسط الرموز البريدية، أو إجراء اختبار t على تقييمات الرضا، أو معاملة الأعداد المنفصلة كقياسات متصلة — هذه كلها أخطاء تنبع من عدم فهم نوع بياناتك. صنّف بياناتك أولاً، ثم اختر أدواتك.

في الدرس التالي، سنستكشف كيفية تصور البيانات بفعالية — اختيار الرسوم البيانية والمخططات المناسبة لأنواع البيانات المختلفة، وتعلم اكتشاف الأنماط والقيم الشاذة والتوزيعات من نظرة واحدة.

النقاط الرئيسية
  • تنقسم البيانات إلى فئتين عريضتين: نوعية (فئوية) وكمية (عددية) — كل منهما يتطلب مناهج تحليلية مختلفة.
  • مقاييس القياس الأربعة — الاسمي والترتيبي والفتري والنسبي — تشكل تسلسلًا هرميًا متزايد الغنى الرياضي.
  • البيانات المنفصلة تأخذ قيمًا قابلة للعد؛ البيانات المتصلة يمكن أن تأخذ أي قيمة في نطاق — وهذا يؤثر على التوزيعات والاختبارات المستخدمة.
  • طريقة جمع البيانات (استطلاع، تجربة، دراسة رصدية) تحدد الاستنتاجات التي يمكنك استخلاصها — التجارب وحدها يمكنها إثبات السببية.
  • حدد نوع بياناتك دائمًا قبل اختيار الأسلوب الإحصائي — عدم التطابق ينتج نتائج غير صحيحة.
الدرس السابق ما هو علم الإحصاء؟ نظرة عامة على الوحدة الدرس التالي المجتمع مقابل العينة