اختبار A/B مقارنة تجريبية بين نسخة أساسية ونسخة معدلة، يحصل عليهما مستخدمون موزعون عشوائيًا، ثم تُقارن نتيجة محددة. يساعد هذا التصميم في فحص أثر التغيير، بينما مقارنة أسبوع قديم بأسبوع جديد قد تتأثر بعوامل أخرى غير التصميم. [1]
الخلاصة السريعة
ابدأ بفرضية ومقياس، ثم وزع المستخدمين عشوائيًا وراجع جودة البيانات والدليل الإحصائي قبل القرار.
- قارن نسخة أساسية وأخرى معدلة بالتزامن والتوزيع العشوائي؛ المقارنة قبل التعديل وبعده لا تعزل أثر الظروف الأخرى. [1]
- حدد التغيير والمقياس وقاعدة القرار مقدمًا، ولا تعتمد على النقر إذا كان السؤال عن إكمال الطلب.
- خطط للمدة والعينة وفق التجربة، وراجع اختلال توزيع المشاركين وتغيرات التنفيذ؛ لا توجد مدة واحدة مناسبة لكل اختبار. [2]
- الفرق العددي وحده لا يثبت تفوقًا؛ اقرأ عدم اليقين، وقيمة p هي احتمال نتيجة مماثلة أو أشد إذا لم يوجد أثر، ضمن افتراضات الاختبار. [3]
- اتخذ قرارًا يراعي النتيجة المهمة وحدود التجربة، وسجّل أيضًا النتيجة غير الحاسمة بدل اختلاق فائز.
ما الذي يجعل المقارنة تجربة A/B؟
في التصميم الأساسي، ترى المجموعة A النسخة الحالية وترى المجموعة B التعديل. توضح Microsoft Research أن توزيع المستخدمين عشوائيًا إلى مجموعتين ومقارنة أفعالهم يختلف عن ملاحظة التحسن بعد تغيير؛ فالأخيرة قد تتأثر بظروف البيئة. [1]
افترض أنك تريد معرفة إن كان توضيح موعد التسليم في صفحة منتج يساعد على إكمال الطلب. إظهار التوضيح هذا الأسبوع ومقارنته بالأسبوع السابق يترك أسئلة مفتوحة: هل تغير العرض أو مصدر الزوار؟ في التجربة المتزامنة تحاول إعطاء المجموعتين ظروفًا متقاربة، مع اختلاف التعديل المقصود.
لا تسمِّ عرض إعلانين على جمهورين مختلفين اختبارًا عشوائيًا بمجرد أن لديهما اسمَي A وB. وثّق طريقة تعيين الأشخاص، وما إذا كان الشخص يحافظ على نسخته خلال التجربة.
اكتب الفرضية واختر مقياسًا واحدًا رئيسيًا
للمثال، اكتب: «نختبر ما إذا كان توضيح وقت التسليم يزيد نسبة المستخدمين الذين يكملون شراءً». اختر هذا الفعل كمقياس رئيسي، واتفق على طريقة تسجيله في النسختين. يمكن متابعة النقر أيضًا، لكن لا تبدل السؤال إلى النقر لمجرد أنه أعطى نتيجة أجمل.
احتفظ بورقة تصميم قصيرة: ما التغيير؟ من يدخل التجربة؟ ما وحدة التوزيع؟ ما المقياس؟ كيف سنقرر؟ في تجربة مبتدئة يسهل تفسير تغيير واضح، مثل إضافة فقرة موعد التسليم مع ثبات بقية الصفحة. إذا غيّرت السعر والصورة والنص معًا، فإن النتيجة تخص الحزمة كلها؛ لا تعزوها إلى عنصر منفرد.
سجّل ملاحظة عن آثار غير مرغوبة تحتاج متابعة، مثل أخطاء الدفع أو شكاوى معلومات مضللة. الهدف من اختبار الصفحة أن تخدم المهمة التي وعدت بها، لا أن تجعل لوحة الأرقام تبدو أفضل.
خطط للعينة والمدة وتحقق من التنفيذ
تنصح إرشادات Microsoft للتجارب بإعطاء وقت وعينة مناسبين، وعدم إدخال تغييرات غير مخططة أثناء الاختبار. كما تعتبر اختلال نسب توزيع المشاركين عن المتوقع إشارة تحتاج معالجة قبل استنتاج النتيجة. ولا تعني الفروق الصغيرة في العدد تلقائيًا وجود خلل؛ يلزم الفحص المناسب. [2]
لا توجد قاعدة عامة تقول إن كل تجربة تكتمل بعد ثلاثة أيام أو مئة زيارة. يعتمد ما تستطيع معرفته على البيانات التي يجمعها تصميمك وحجم الأثر الذي يهمك. اختر طريقة التحليل وقاعدة الإيقاف قبل التشغيل مع من يفهم أداة التجربة؛ تختلف الأدوات في أسلوب الاستدلال.
اختبر تسجيل الحدث في A وB، وتأكد أن تغييرًا تقنيًا لم يمنع إحدى النسختين من إرسال البيانات. إذا وقع عطل مؤثر، دوّن توقيته وافحص أثره قبل متابعة المقارنة.
مثال: الفرق بين 4% و4.5% ليس حكمًا نهائيًا
افترض للتوضيح فقط أن A سجلت 16 شراءً من 400 مستخدم، وB سجلت 18 شراءً من 400 مستخدم. المعدلان 4% و4.5%؛ الفرق نصف نقطة مئوية، والزيادة النسبية 12.5%. هذه حسابات وصفية لأعداد افتراضية، ولا نعلن منها دلالة إحصائية.
عند استعمال اختبار يعرض قيمة p، فإنها تصف مدى احتمال رصد فرق كهذا أو أشد بافتراض عدم وجود أثر، مع صحة افتراضات التحليل. لا تعني احتمال أن الفكرة صحيحة، ولا تمنح يقينًا بأن النسخة ستتفوق مستقبلًا. [3]
اقرأ حجم الفرق وعدم اليقين معه، واسأل إن كان الفرق المحتمل مهمًا عمليًا. قد يكون التقرير غير حاسم، أو تكون البيانات غير صالحة أصلًا. لا يحول تقريب النسبة أو اختيار يوم ملائم حالة غير حاسمة إلى فوز.
| النسخة الافتراضية | الشراء / المستخدمون | المعدل الوصفي |
|---|---|---|
| A | 16 / 400 | 4% |
| B | 18 / 400 | 4.5% |
حوّل النتيجة إلى قرار قابل للمراجعة
يمكن أن تنتهي التجربة باعتماد تعديل، أو إبقاء النسخة الحالية، أو الحاجة إلى بيانات أفضل. دوّن النتيجة بالمقياس الذي بدأت به، وأرفق ما تغير أثناء التشغيل. لا تحذف تجربة لم تعطِ نتيجة مرغوبة؛ فهي توضح حدود ما تعرفه.
إذا كان توضيح التسليم مفيدًا ضمن جمهور الاختبار، فاكتب نطاقه ولا تمد النتيجة إلى كل المنتجات وكل القنوات بلا فحص. وإذا زادت النقرات ولم يتحسن الشراء، فالسؤال التالي يتعلق بالانتقال بعد النقرة، لا بتسمية النقرات مبيعات.
احتفظ بملخص من ثلاثة أسطر: ما اختُبر، وما تدعمه البيانات، وما القرار التالي. بهذه الطريقة يستطيع فريق آخر فهم سبب التعديل ويعرف متى يحتاج إلى إعادة فحصه.
المصادر ومتابعة القراءة
- Microsoft Research: Experimentation and the North Star Metric (يفتح في نافذة جديدة)microsoft.com
- Microsoft Learn: Experiments Best Practices and Recommendations (Experiments Recap) (يفتح في نافذة جديدة)learn.microsoft.com
- Firebase: لمحة عن اختبارات A/B (يفتح في نافذة جديدة)firebase.google.com
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.