ML 101
M05 · L01
الوحدة 5

التجميع — K-Means

لا تسميات. لا معلّم. فقط البيانات والبنية. التعلم غير الخاضع للإشراف يكشف عن تجمّعات خفيّة — وخوارزمية K-Means هي الخوارزمية التي أطلقت ألف تجزئة.

01 / 13
ML 101
M05 · L01
المهمة

التجميع بدون تسميات

يُقسّم التجميع البيانات إلى مجموعات بحيث تكون التشابه داخل المجموعة مرتفعًا والتشابه بين المجموعات منخفضًا. لا حاجة لحقيقة أرضية — تظهر البنية من البيانات ذاتها.

المدخل
n نقطة
المخرج
K مجموعات
02 / 13
ML 101
M05 · L01
الحلقة التكرارية

تعيين ← تحديث ← تكرار

  • التهيئة — وضع K نقاط مرجعية (عشوائيًا أو عبر K-Means++)
  • التعيين — تنضم كل نقطة إلى أقرب نقطة مرجعية
  • التحديث — إعادة حساب كل نقطة مرجعية كمتوسط المجموعة
  • الفحص — التوقف إذا لم تتغير التعيينات
  • مضمون التقارب؛ يتقارب إلى حدٍّ أدنى محلي
03 / 13
ML 101
M05 · L01
الهدف

تقليل القصور الذاتي

تُقلّل K-Means مجموع مربعات المسافات داخل كل مجموعة من كل نقطة إلى نقطتها المرجعية. القصور الذاتي الأقل = مجموعات أكثر إحكامًا وتماسكًا.

دالة هدف K-Means
J = \displaystyle\sum_{k=1}^{K} \sum_{\mathbf{x} \in C_k} \|\mathbf{x} - \boldsymbol{\mu}_k\|^2
04 / 13
ML 101
M05 · L01
المعامل الفائق

اختيار K

  • طريقة الكوع — رسم القصور الذاتي مقابل K؛ البحث عن نقطة الانعطاف
  • درجة Silhouette — تقيس التماسك مقابل الفصل لكل نقطة
  • النطاق من −1 (مجموعة خاطئة) إلى +1 (مثالي)؛ تعظيمها على K
  • معرفة المجال غالبًا أكثر موثوقية
  • ليس أيٌّ من المقياسين حاسمًا — عاملهما كإرشادات
05 / 13
ML 101
M05 · L01
مقياس الجودة

درجة Silhouette

a(i) = متوسط المسافة إلى نقاط نفس المجموعة. b(i) = متوسط المسافة إلى أقرب مجموعة أخرى. s(i) قريبة من +1 تعني تجميعًا جيدًا؛ قريبة من 0 تعني حدودية.

صيغة Silhouette
s(i) = \dfrac{b(i) - a(i)}{\max(a(i),\,b(i))}
06 / 13
ML 101
M05 · L01
بداية أذكى

K-Means++

التهيئة العشوائية تُخاطر بالحدود الدنيا المحلية السيئة. تُبذر K-Means++ النقاط المرجعية باختيار كل نقطة جديدة باحتمال يتناسب مع مربع مسافتها من أقرب نقطة مرجعية موجودة — توزيعها بذكاء.

الضمان
تقريب O(log K) للقيمة المثلى • الآن الإعداد الافتراضي في scikit-learn
07 / 13
ML 101
M05 · L01
القيود

متى تفشل K-Means

  • افتراض الشكل الكروي — لا تجد مجموعات منحنية أو ممتدة
  • الأحجام المتساوية — تنقسم المجموعات الكبيرة وتندمج الصغيرة
  • الحساسية للقيم الشاذة — نقطة متطرفة واحدة تسحب النقطة المرجعية بعيدًا
  • K مطلوبة مسبقًا — يجب التخمين أو البحث
  • إقليدية فقط — غير مناسبة للبيانات الفئوية أو النصية
08 / 13
ML 101
M05 · L01
على نطاق واسع

Mini-Batch K-Means

تحمّل K-Means القياسية كل البيانات في كل تكرار. تُحدّث Mini-Batch K-Means النقاط المرجعية على عينة فرعية عشوائية في كل خطوة — مثل SGD للتجميع. أسرع بكثير على ملايين النقاط.

السرعة
أسرع بكثير
الجودة
قصور ذاتي أعلى قليلًا
09 / 13
ML 101
M05 · L01
ملاحظة عملية

القياس قبل التجميع

تستخدم K-Means المسافة الإقليدية. ميزة ذات قيم كبيرة تهيمن على جميع حسابات المسافة. قيّس دائمًا إلى متوسط صفري وتباين وحدوي قبل تشغيل K-Means.

قاعدة إرشادية
StandardScaler قبل KMeans • أشيع مصدر لتجميع ضعيف
10 / 13
ML 101
M05 · L01
العالم الحقيقي

أين تتألق K-Means

  • تجزئة العملاء — تجميع المستخدمين حسب السلوك
  • ضغط الصور — تقليص الألوان إلى K قيمة تمثيلية
  • تجميع الوثائق — اكتشاف الموضوعات في مجموعات نصية كبيرة
  • كشف الشذوذ — النقاط البعيدة عن أي نقطة مرجعية هي قيم شاذة
  • هندسة الميزات — عضوية المجموعة كميزة جديدة
11 / 13
ML 101
اختبار سريع

تحقّق ممّا ثبت

أربعة أسئلة من هذا الدرس. أجب لترى السبب — يظهر الشرح سواء أصبتَ أم أخطأت. ولا شيء يُسجَّل أو يُحفَظ.

السؤال 1 من 0
النتيجة 0/0

12 / 13
ML 101
ملخص
مراجعة

ما تعلّمته

تُكرّر K-Means تعيين←تحديث لتقليل القصور الذاتي. تُبذر K-Means++ بذكاء. يساعد الكوع وSilhouette في اختيار K. تتوسّع Mini-Batch إلى الملايين. التالي: التجميع الهرمي وDBSCAN — تجميع بدون K محدد مسبقًا.

13 / 13