فصل سجلات الشخص بمعرفات مختلفة قد يخفي تداخلا بين التدريب والاختبار إذا كانت تلك المعرفات أسماء بديلة للشخص نفسه. عندما يقصد التقييم أشخاصا جددًا، نحتاج مراجعة هوية الكيان الذي تجمعه الرموز، لا الاكتفاء باختلاف نصوصها.
الخلاصة السريعة
لا؛ فصل رموز مجموعات مختلفة لا يضمن فصل الأشخاص إذا أمكن أن يعود رمزان إلى الشخص نفسه.
- تستعمل GroupKFold تسميات مجموعات نقدمها لكل عينة، وتفصل مجموعات غير متداخلة. [1] هذا الشرط يتعلق بالتسميات التي أدخلناها.
- نفترض خريطة موثوقة تربط أ 7 وب 19 بالشخص ك 1. وضع سجلات أ 7 في التدريب وب 19 في الاختبار يفصل الرمزين، لكنه يضع ك 1 في الاثنين.
- عند تقييم أشخاص جدد، راجع التداخل بعد الربط بالهوية المقصودة. لا تدمج شخصين لمجرد تشابه الاسمين، ولا تعتبر هوية مجهولة شخصا جديدا مؤكدا.
- حدد نطاق الكيان وقاعدة الربط ووثق الحالات غير المحسومة قبل الفصل. غياب التداخل في الهوية المناسبة لا يكفي وحده لإثبات جودة التنبؤ أو منع كل أسباب التسرب.
ما الذي تسميه أداة الفصل مجموعة؟
تصف وثائق scikit-learn GroupKFold بأنه فصل بمجموعات غير متداخلة، وتحدد groups بوصفها تسميات مجموعات العينات التي يقدمها المستعمل. [1]
إذا أعطينا صفوفا التسميات أ 7 وب 19 ، فإنهما قيمتان مختلفتان في هذا الحقل. لكن الأداة لا تستخرج من اختلاف الكتابة دليلا مستقلا عن أن صاحبيهما شخصان مختلفان في الواقع. معنى المجموعة يأتي من تعريفنا ومصدر الربط.
سنفترض أن سؤال التقييم هو التنبؤ لشخص لم تظهر سجلاته في التدريب. قد تكون مهمة أخرى عن سجل جديد للشخص المعروف مختلفة؛ لا نجعل الفصل على مستوى الشخص شرطا لجميع أسئلة التنبؤ دون تحديد المقصود.
كيف يتسلل الشخص نفسه عبر اسمين؟
نؤلف أربعة سجلات، ونفترض وجود خريطة مصدر موثوقة لهذا المثال تربط أ 7 وب 19 بك 1. لم نستنتج هذه العلاقة من تشابه الأسماء، ولم نجمع بيانات أشخاص فعليين. نعرف الهوية هنا لأننا أعلنّاها في فرض المثال.
مجموعة الرموز الخام في التدريب هي أ 7 ، وفي الاختبار ب 19 ؛ تقاطعهما فارغ. بعد تطبيق الخريطة تصبح مجموعة الأشخاص في الطرفين ك 1 ، فيظهر الشخص المشترك الذي أخفاه فحص الرموز.
هذه المقارنة تثبت مخالفة هدف «شخص لم يظهر في التدريب» في مثالنا. لا توجد تنبؤات أو وسوم أو درجات نجاح، لذلك لا نحسب مقدار تضخم الأداء أو نقرر أن النموذج حفظ الشخص بالفعل.
| السجلات الافتراضية | المعرف الخام | هوية الشخص المفترضة | المجموعة |
|---|---|---|---|
| ر 1 ور 2 | أ 7 | ك 1 | تدريب |
| ر 3 ور 4 | ب 19 | ك 1 | اختبار |
لماذا لا نخمن الربط من الاسم؟
قد يتشابه اسما شخصين مختلفين، وقد يحمل الشخص نفسه رمزين مختلفين في مصدرين. حذف مسافة أو توحيد كتابة اسم لا يقدم وحده دليل الهوية التي اشترطناها في الخريطة. نراجع معلومات الربط المناسبة للمصدر.
إذا بقيت هوية بعض السجلات غير محسومة، فإن توليد رمز فريد لكل منها لا يجعلها أشخاصا مستقلين مؤكّدين. نحتفظ بحالة عدم الحسم ونختار سياسة تقييم معلنة تناسبها، بدلا من إخفاء الشك في رمز جديد.
كذلك نحدد ما إذا كانت المجموعة شخصا أو حسابا أو أسرة. قد يملك الشخص عدة حسابات، لكن السؤال قد يقصد الحساب أو الشخص. لا نستعمل الكلمة نفسها لمستويين مختلفين ثم نقارن التداخل بينهما.
ما المراجعة اللازمة قبل حساب الأداء؟
نقترح حفظ خريطة المعرفات مع مصدرها ونسختها ونطاق استعمالها، ثم إسناد هوية المجموعة المقصودة لكل صف قبل الفصل. نراجع قوائم هذه الهويات في التدريب والاختبار ونوثق أي تقاطع أو حالة مجهولة.
إذا تغيرت الخريطة لاحقا واكتشفنا أن رمزين لشخص واحد، فقد يتغير الحكم على فصل سابق. نحفظ التقسيم والخريطة التي استند إليها بدلا من الاعتماد على أسماء الملفات أو أحدث عدد للمجموعات وحده.
وبعد تحقق الفصل على المستوى المطلوب، تبقى أسئلة توفر المدخلات وصحة الوسوم وتمثيل الأشخاص الجدد. فحص الهوية يعالج شرطا محددا؛ لا يتحول نجاحه إلى ضمان أداء النموذج أو اكتمال مراجعة التسرب.
المصادر ومتابعة القراءة
- scikit-learn: GroupKFold (يفتح في نافذة جديدة)scikit-learn.org
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
