تقنية

حذف السجلات الناقصة: كيف قد يتغير تمثيل المجموعات؟

عشرة صفوف موزعة خمسة لكل مسار، ثم شرط اكتمال الملاحظة يبقي خمسة من أ وواحدا من ب وتراجع النتيجة
رسم أصلي لتغير تركيب مثال، ولا يقيس التحيز أو أداء نموذج فعلي.

حذف السجلات الناقصة قد يزيل الفراغات من الملف المتبقي، لكنه يغير أيضا السجلات التي يراها النموذج. إذا كانت مجموعة تفقد قيما أكثر من أخرى، فقد تصبح أقل تمثيلا بعد الحذف. لذلك نراجع من حُذف وما سؤال التحليل، بدلا من الحكم على النتيجة بخلوها من الخانات المفقودة.

الخلاصة السريعة

قارن تركيب البيانات قبل الحذف وبعده، وحدد الحقول اللازمة للمهمة؛ الملف المتبقي بلا فراغات لا يثبت أن الاستبعاد مناسب.

  • يحذف dropna الصفوف التي تحمل أي قيمة مفقودة افتراضيا، ويمكن تحديد أعمدة القرار باستخدام subset. [1]
  • في المثال بقي خمسة من المجموعة أ وواحد من ب؛ تغير تمثيل أ من 50٪ إلى نحو 83.3٪ دون جمع سجلات جديدة.
  • أثر الحذف في الاستنتاج يعتمد على الغياب والسؤال والنموذج؛ ليس الحذف منحازا دائما، ولا تكفي نسبة عامة للحكم عليه. [2]
  • وثق السجلات المستبعدة وسببها، وقارن المجموعات والحقول المطلوبة؛ لا تعلن تحسن النموذج من انخفاض الفراغات وحده.

ما القاعدة التي تستبعد الصف؟

في pandas، يعمل DataFrame.dropna على الصفوف افتراضيا، ويزيل الصف عندما توجد قيمة مفقودة وفق how="any". وتحدد subset الأعمدة التي تدخل في قرار الإزالة. [1]

نقترح جدولا افتراضيا لبطاقات وصلت عبر مسارين أ وب. يحمل كل صف اسم المسار وطول البطاقة وملاحظة اختيارية. قبل الحذف نسأل هل تستلزم المهمة طول البطاقة فقط أم الملاحظة أيضا؟ قد نستبعد صفا صالحا للسؤال لأن حقلا اختياريا فيه غائب، إذا تعاملنا مع كل الأعمدة كأنها مطلوبة بالقدر نفسه.

كيف يتغير تمثيل المجموعتين في المثال؟

لدينا خمس بطاقات من أ وخمس من ب، ولكل بطاقة طول مسجل. نفترض أن الملاحظات مكتملة في أ، لكنها غائبة لأربع بطاقات من ب. إذا اشترطنا اكتمال كل الحقول، بقيت بطاقات أ الخمس وبطاقة واحدة من ب. هذه أعداد من إنشاء الكاتب، لا نتائج حذف ملف فعلي.

  • قبل الحذف تمثل أ نصف الصفوف:5 من10. بعده تمثل5 من6، أي نحو 83.3٪.
  • المجموعة ب تقل في الملف المتبقي بسبب شرط الملاحظة؛ لا لأننا وجدنا أن بطاقاتها غير صحيحة.
  • هذا يثبت تغير تركيب المثال، ولا يقيس أثره على نموذج أو يثبت أن نسبة المجتمع الحقيقي كانت نصفا.
المجموعة الافتراضيةالصفوف قبل الحذفالصفوف التي تبقى بشرط كل الحقول
أ55
ب51
المجموع106

هل كل حذف يسبب التحيز نفسه؟

يبين الكتاب أن عواقب حذف الحالات الكاملة تعتمد على موضع الغياب، والمعلمة المطلوب تقديرها، وشكل النموذج؛ لذلك لا يكفي معدل الغياب وحده قاعدة للحكم على الحذف. [2]

في مثالنا لا نطلق حكما عاما على كل تحليل. إذا كان السؤال مقارنة أطوال البطاقات في المسارين، نراجع لماذا نستبعد بطاقة طولها معروف بسبب ملاحظة اختيارية. وإذا كانت الملاحظة نفسها لازمة لمهمة أخرى، فذلك سؤال مختلف يحتاج إجراء مناسبا له.

كما لا نحول تغير تركيب الصفوف إلى إثبات أن أي تقدير سيكون منحازا بالمقدار نفسه. نحدد ما نقيسه، وكيف ترتبط حالات الغياب بالمعلومات المطلوبة، وما الذي نعرفه عن السجلات المستبعدة.

ما الفحص الذي نسجله قبل اعتماد الاستبعاد؟

نقترح حفظ نسخة الإدخال وقاعدة الحذف وأسماء الحقول المشمولة وقائمة الصفوف التي خرجت. ونقارن توزيع المسارات أو المجموعات قبل الإجراء وبعده. إذا جعل شرط حقل غير مطلوب بعض الحالات تختفي، نراجع نطاق القرار بدلا من قبول النتيجة لمجرد أنها أصغر وأكمل شكليا.

ولا نفترض أن التعويض بديل مضمون لكل حذف. نعرض السبب والقيود والبيانات التي لم تعد ممثلة، ثم نقيم اختيار الإجراء وفق المهمة عندما تتوفر تجربة مناسبة. لم ندرّب نموذجا في هذا المثال؛ لا نستنتج منه دقة أو تحسنا مقاسا.

المصادر ومتابعة القراءة

  1. pandas: DataFrame.dropna (يفتح في نافذة جديدة)pandas.pydata.org
  2. Stef van Buuren: Ad-hoc solutions, listwise deletion (يفتح في نافذة جديدة)stefvanbuuren.name

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.