الفرق بين العينة الميسرة والعشوائية يتعلق بطريقة دخول الحالات إلى الاختيار، وليس بترتيب الصفوف بعد جمعها فقط. إذا جمعت الملفات الأسهل وصولا ثم خلطتها عشوائيا، فقد تغير من يختار داخل هذه المجموعة، لكن الحالات التي لم تدخلها أصلا تبقى خارج السحب. لذلك لا يثبت اسم «خلط عشوائي» أن البيانات تمثل كل النطاق المطلوب.
الخلاصة السريعة
افصل اختيار مجموعة الملفات المتاحة عن السحب داخلها؛ العشوائية في المرحلة الثانية لا تعيد الحالات المستبعدة من المرحلة الأولى.
- تصف Statistics Canada العينة الميسرة باختيار المتاح بصورة غير احتمالية، مع احتمال تحيز مرتبط بما أمكن الوصول إليه. [1] لا يصبح هذا التصميم سحبا شاملا بالخلط اللاحق.
- في مثالنا ستة سجلات مطلوبة، لكن المجموعة المتاحة تضم 1 و 2 و 3 فقط؛ نختار اثنين من هذه الثلاثة بأزواج متساوية الاحتمال.
- فرصة إدراج كل سجل متاح 2 من 3 ، وفرصة 4 و 5 و 6 صفر؛ أما سحب اثنين ببساطة من الستة كاملة فيعطي لكل سجل 1 من 3 ، وفق شروطه.
- اعرض حدود المجموعة التي جمعناها وكيف اختيرت؛ قد تفيد لاختبار إجراء محدد، لكن لا تعمم صفاتها أو أداء نموذج على المستبعدين بلا دليل مناسب.
ما الذي تقرره مرحلة جمع الملفات؟
في المعاينة غير الاحتمالية، قد تختار الوحدات بحسب سهولة توفرها بدلا من آلية احتمالية معلنة لكل المجتمع. وتشير Statistics Canada إلى صعوبة تعميم هذه العينات دون افتراضات عن تمثيلها للمجتمع. [1]
نفترض أننا نريد دراسة ستة سجلات محددة، لكننا جمعنا الثلاثة الأولى لأنها متاحة في مجلد قريب، ولم نصل إلى الثلاثة الأخرى. السجلات الستة جزء من هدفنا التعليمي المعلن؛ وجود الثلاثة في المجلد لا يجعلها كل ذلك الهدف.
قد تكون للملفات الناقصة صفات مثل الموجودة أو مختلفة عنها؛ لا نعرف من سهولة الوصول وحدها. ولهذا لا نحكم بأنها ستسوء نتيجة النموذج حتما، ولا نحكم بأن غيابها بلا أثر. نسجل ما شملته طريقة الجمع وما استبعدته.
ماذا يغير الخلط داخل المجموعة المتاحة؟
نختار اثنين بلا إرجاع من 1 و 2 و 3 ، ونعرف تصميم السحب بأنه يعطي الأزواج 1 مع 2 و 1 مع 3 و 2 مع 3 الفرصة نفسها. يمكن أن يحققه خلط منتظم الاحتمال ثم أخذ الأولين، لكن وصف «خلط» وحده لا يثبت أنه نفذ بهذه الشروط.
يظهر كل سجل من الثلاثة في زوجين من الأزواج الثلاثة، فتكون فرصة إدراجه 2 على 3. نميز بين احتمال اختيار السجل داخل المجموعة المتاحة واحتمال دخوله تلك المجموعة من الأصل. الأول يمكن حسابه هنا، والثاني لم تحدده قرعة للمجتمع كله.
الأرقام في المثال نتيجة عد الخيارات المفترضة؛ لم نختر ملفات حقيقية أو نشغل أداة خلط. وليس ترتيب العرض في جدول المقال عملية جمع بيانات جديدة.
أين تبقى الحالات التي لم تجمع؟
لا يظهر أي من 4 و 5 و 6 في الأزواج المتاحة، لذلك فرصة إدراجها في هذه المرحلة صفر. مهما تكرر الخلط داخل القائمة نفسها، فلن ينشأ منها سجل غائب. هذه نتيجة نطاق الاختيار، لا ادعاء بأن محتوى السجلات الغائبة معروف.
- التصميم الثاني مقارنة افتراضية مشروطة بإتاحة الستة كاملة، وليس إجراء نفذناه.
- تشابه بعض الإحصاءات في العينة لا يثبت أن آلية الجمع الأولى أعطت الغائبين فرصة.
| تصميم المثال | السجلات 1 و 2 و 3 | السجلات 4 و 5 و 6 |
|---|---|---|
| اختيار اثنين من المتاحة الثلاثة بأزواج متساوية | فرصة إدراج 2 من 3 لكل سجل | فرصة إدراج صفر |
| سحب بسيط لاثنين من الستة الكاملة بلا إرجاع | فرصة إدراج 1 من 3 لكل سجل | فرصة إدراج 1 من 3 لكل سجل |
كيف نستخدم البيانات مع وصف صادق؟
قد تستخدم المجموعة المتاحة للتحقق من أن استيراد الملفات أو عرض حقل محدد يعمل في هذه الحالات. ذلك استعمال محدود لا يحتاج أن نصفها بتمثيل المجتمع كله. اكتب ما اختبرته فعلا، وما لا تتناوله البيانات.
إذا قسمت هذه الملفات لاحقا إلى تدريب واختبار بطريقة عشوائية، فإن القسمة تظل داخل المجموعة التي وصلت إليها. نجاح فحص هناك لا يثبت تلقائيا أداء النموذج على 4 و 5 و 6 أو على حالات أوسع لم تجمع؛ تحتاج بيانات وتقييما يناسبان الادعاء الجديد.
عند إعداد التقرير، افصل نطاق الجمع وآليته عن طريقة السحب الداخلي. وقد تحتاج لتغيير طريقة الوصول أو لتضييق السؤال إلى النطاق الذي درسته. لا تزعم أن إضافة صفوف من المجلد نفسه تعالج وحدها كل حدود الاختيار.
المصادر ومتابعة القراءة
- Statistics Canada: Non-probability sampling (يفتح في نافذة جديدة)www150.statcan.gc.ca
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
