التجميع — K-Means
لا تسميات. لا معلّم. فقط البيانات والبنية. التعلم غير الخاضع للإشراف يكشف عن تجمّعات خفيّة — وخوارزمية K-Means هي الخوارزمية التي أطلقت ألف تجزئة.
التجميع بدون تسميات
يُقسّم التجميع البيانات إلى مجموعات بحيث تكون التشابه داخل المجموعة مرتفعًا والتشابه بين المجموعات منخفضًا. لا حاجة لحقيقة أرضية — تظهر البنية من البيانات ذاتها.
تعيين ← تحديث ← تكرار
- التهيئة — وضع K نقاط مرجعية (عشوائيًا أو عبر K-Means++)
- التعيين — تنضم كل نقطة إلى أقرب نقطة مرجعية
- التحديث — إعادة حساب كل نقطة مرجعية كمتوسط المجموعة
- الفحص — التوقف إذا لم تتغير التعيينات
- مضمون التقارب؛ يتقارب إلى حدٍّ أدنى محلي
تقليل القصور الذاتي
تُقلّل K-Means مجموع مربعات المسافات داخل كل مجموعة من كل نقطة إلى نقطتها المرجعية. القصور الذاتي الأقل = مجموعات أكثر إحكامًا وتماسكًا.
اختيار K
- طريقة الكوع — رسم القصور الذاتي مقابل K؛ البحث عن نقطة الانعطاف
- درجة Silhouette — تقيس التماسك مقابل الفصل لكل نقطة
- النطاق من −1 (مجموعة خاطئة) إلى +1 (مثالي)؛ تعظيمها على K
- معرفة المجال غالبًا أكثر موثوقية
- ليس أيٌّ من المقياسين حاسمًا — عاملهما كإرشادات
درجة Silhouette
a(i) = متوسط المسافة إلى نقاط نفس المجموعة. b(i) = متوسط المسافة إلى أقرب مجموعة أخرى. s(i) قريبة من +1 تعني تجميعًا جيدًا؛ قريبة من 0 تعني حدودية.
K-Means++
التهيئة العشوائية تُخاطر بالحدود الدنيا المحلية السيئة. تُبذر K-Means++ النقاط المرجعية باختيار كل نقطة جديدة باحتمال يتناسب مع مربع مسافتها من أقرب نقطة مرجعية موجودة — توزيعها بذكاء.
متى تفشل K-Means
- افتراض الشكل الكروي — لا تجد مجموعات منحنية أو ممتدة
- الأحجام المتساوية — تنقسم المجموعات الكبيرة وتندمج الصغيرة
- الحساسية للقيم الشاذة — نقطة متطرفة واحدة تسحب النقطة المرجعية بعيدًا
- K مطلوبة مسبقًا — يجب التخمين أو البحث
- إقليدية فقط — غير مناسبة للبيانات الفئوية أو النصية
Mini-Batch K-Means
تحمّل K-Means القياسية كل البيانات في كل تكرار. تُحدّث Mini-Batch K-Means النقاط المرجعية على عينة فرعية عشوائية في كل خطوة — مثل SGD للتجميع. أسرع بكثير على ملايين النقاط.
القياس قبل التجميع
تستخدم K-Means المسافة الإقليدية. ميزة ذات قيم كبيرة تهيمن على جميع حسابات المسافة. قيّس دائمًا إلى متوسط صفري وتباين وحدوي قبل تشغيل K-Means.
أين تتألق K-Means
- تجزئة العملاء — تجميع المستخدمين حسب السلوك
- ضغط الصور — تقليص الألوان إلى K قيمة تمثيلية
- تجميع الوثائق — اكتشاف الموضوعات في مجموعات نصية كبيرة
- كشف الشذوذ — النقاط البعيدة عن أي نقطة مرجعية هي قيم شاذة
- هندسة الميزات — عضوية المجموعة كميزة جديدة
ما تعلّمته
تُكرّر K-Means تعيين←تحديث لتقليل القصور الذاتي. تُبذر K-Means++ بذكاء. يساعد الكوع وSilhouette في اختيار K. تتوسّع Mini-Batch إلى الملايين. التالي: التجميع الهرمي وDBSCAN — تجميع بدون K محدد مسبقًا.