اختبار A/B
تجارب عشوائية خاضعة للتحكم مطبّقة على المنتجات الرقمية. كيف تختبر شركات التكنولوجيا آلاف التغييرات — وكيف تفعلها بدقة.
التحكم مقابل المتغير
قسّم المستخدمين عشوائيًا. أظهر A (التحكم) لمجموعة وB (المتغير) للأخرى. قِس ما إذا كان الفرق أكبر من الصدفة.
الفرضية والمقياس
حدّد مسبقًا ما تغيّره وما تقيسه والاتجاه المتوقع. التزم بـمقياس أساسي واحد قبل الإطلاق.
- حساس — يتغير عندما ينجح العلاج
- موقوت — قابل للقياس خلال نافذة الاختبار
- متوائم — مرتبط بقيمة الأعمال الحقيقية
حجم العينة
حدّد الحد الأدنى للتأثير القابل للكشف قبل الإطلاق. التأثيرات الأصغر تحتاج مستخدمين أكثر — استهدف أصغر تغيير سيؤثر فعلًا على قرار الشحن.
العشوائية بالمستخدم
خصّص المستخدمين للمجموعات بتجزئة معرّفهم — وليس بمشاهدة الصفحة. هذا يمنح كل مستخدم تجربة متسقة ويمنع التلوث داخل الجلسة.
مدة الاختبار
شغّل بما يكفي للعينة المطلوبة ولتغطية دورات السلوك الطبيعية. تتلاشى تأثيرات الجدة بعد أيام — السلوك الثابت هو ما يهم.
تحليل النتائج
اختر الاختبار بناءً على نوع المقياس. أبلّغ دائمًا بـفترة ثقة لحجم التأثير — وليس فقط قيمة p.
- مستمر — اختبار t ذو عينتين (متوسط الإيرادات، مدة الجلسة)
- ثنائي — اختبار z لنسبتين (معدل النقر، التحويل)
- عددي — اختبار بواسون أو مربع كاي
إحصائية الاختبار
لمعدلات التحويل: قارن p̂₁ و p̂₂ نسبةً إلى التباين المجمّع.
اختبار A/B البايزي
بدلًا من قيمة p، احسب: “P(B > A)” — احتمالية أن المتغير أفضل. أكثر بداهةً ويتعامل مع المراقبة المستمرة بشكل أكثر طبيعية.
مشكلة التطلع المبكر
التحقق اليومي والتوقف عند p < 0.05 يُضخّم الإيجابيات الكاذبة من 5% إلى أكثر من 25%. قيمة p تتذبذب — مصادفتها منخفضة ليست إشارة حقيقية.
الاختبار التسلسلي
حدّد مسبقًا التحليلات المؤقتة بعتبات معدّلة. حدود O’Brien-Fleming متحفظة مبكرًا وتخفف عند النظرة النهائية — تتحكم في الخطأ الكلي عند α بالضبط.
- O’Brien-Fleming — الحد التسلسلي الكلاسيكي
- قيم p الصالحة دائمًا — صالحة في أي وقت توقف
- قواعد التوقف البايزية — توقف عند تجاوز P(B>A) العتبة
ما تعلمته اليوم
حدّد كل شيء مسبقًا. عشوئ بالمستخدم. تحقق من SRM. شغّل المدة الكاملة. أبلّغ بفترات الثقة. تجنب التطلع المبكر — أو استخدم الاختبار التسلسلي إذا احتجت للتطلع.