تقنية

ترميز الهدف لصفوف التدريب: هل يكفي فصل الاختبار؟

متوسطا فئتين في طيتين مختلفتين يوضحان تمثيل التدريب من الطية الأخرى مقابل خريطة كامل التدريب المحفوظة
مثال حسابي مؤلف لتمييز ناتج الترميز المتقاطع من الخريطة المحفوظة.

ترميز الهدف لصفوف التدريب يحتاج إلى مراجعة الصفوف التي شاركت في حساب رمز كل صف. عزل الاختبار النهائي لا يجيب وحده عن هذا السؤال داخل التدريب. نقرأ عقد TargetEncoder ونقارن متوسطات فئتين في طيتين معلنتين، دون ملاءمة متنبئ أو قياس أدائه.

الخلاصة السريعة

لا؛ لتمثيل التدريب نفسه، يميز TargetEncoder الترميز المتقاطع في fit_transform عن تعلم خريطة واحدة ثم تحويل التدريب بها.

  • توثق TargetEncoder أن fit_transform يستخدم ترميزا متقاطعا، بخلاف fit(X,y).transform(X). [1] وجود اختبار معزول لا يغير معنى استدعاء التحويل.
  • نؤلف طيتين وفئتين معلومتين في كل منهما، وهدفا مستمرا وsmooth=0. متوسطا أ وب في الأولى 4 و 12 ، وفي الثانية 22 و 32 ؛ نستخدم طية مانحة لترميز الأخرى.
  • تمثيل أ في الطية الأولى يكون 22 ، وفي الثانية 4 وفق حسابنا، بينما متوسط أ في كامل التدريب 13. هذه أرقام يدوية تحت الشروط المعلنة، لا مخرجات مكتبة.
  • يوثق الدليل أن fit_transform يحفظ أيضا ترميزات تعلمت من كامل التدريب لتحويل بيانات لاحقة. [2] الخريطة المحفوظة ليست التمثيل المتقاطع المعاد لصفوف التدريب، ولا تثبت هذه المقارنة جودة نموذج.

أي تمثيل نطلب من المحول؟

يميز عقد TargetEncoder بين fit_transform للتدريب وبين fit ثم transform على التدريب نفسه؛ الترميز المتقاطع سبب هذا الاختلاف. [1]

نحدد أن السؤال يخص مصفوفة التدريب التي ستدخل متنبئا، لا خريطة نستعملها لاحقا لفئة معلومة. ترميز الهدف يعتمد إجابات التدريب؛ لذلك نراجع من تبرع بتلك الإجابات لحساب كل تمثيل، حتى إذا لم نفتح الاختبار النهائي.

نفترض هنا هدَفا مستمرا، ونختار smooth=0 لعزل متوسط الفئة دون مزج بمتوسط عام. يبين الدليل المتوسط الشرطي وصيغة المزج لهذا الهدف. [2] لا نستخدم إعداد auto أو هدف تصنيف متعدد الفئات في حسابنا.

كيف نحسب الطية المانحة؟

نؤلف ثمانية صفوف، مقسمة طيتين من أربعة. في الأولى أهداف أ هي 2 و 6 ، وأهداف ب هي 10 و 14 ؛ المتوسطان 4 و 12. في الثانية أهداف أ هي 20 و 24 ، وأهداف ب هي 30 و 34 ؛ المتوسطان 22 و 32. كل فئة موجودة في الطيتين، ولا توجد قيم غائبة.

نعلن تقسيم الترميز: صفوف الطية الثانية تمنح الإحصاء لصفوف الأولى، ثم تمنح الأولى الإحصاء للثانية. لا نفسر ذلك بأنه حذف صف واحد في كل مرة؛ الطية المحجوزة كلها مستبعدة من الإحصاء الذي يمثلها.

يصف الدليل هذا المبدأ باستعمال الطيات الأخرى لترميز الطية المحجوزة. [2] وفي جدولنا يحدد وجود الفئتين لدى المانح معنى المتوسط؛ لم نحتاج إلى قاعدة فئة لم يرها المانح.

الصفوف التي نمثلهامتوسط أ لدى المانحمتوسط ب لدى المانح
الطية الأولى؛ مانحها الثانية2232
الطية الثانية؛ مانحها الأولى412
كل التدريب بخريطة واحدة؛ للمقارنة1322

لماذا تختلف الخريطة الواحدة؟

إذا حسبنا إحصاء من الصفوف الثمانية معا، فأهداف أ مجموعها 52 وعددها أربعة، فيكون المتوسط 13. وأهداف ب مجموعها 88 ، فيكون المتوسط 22. استعمال هذه الخريطة على التدريب يعطي كل صف أ العدد 13 ، لا 22 في الأولى و 4 في الثانية.

الاختلاف ليس تغيير اسم الفئة أو خطأ تقريب؛ الصفوف التي دخلت الإحصاء تغيرت. كما أن أعدادنا لا تصف كل إعداد ممكن للترميز: ثبتنا التقسيم والهدف المستمر وغياب المزج ووجود الفئات لدى المانح.

لم نستدع fit_transform أو ندرّب متنبئا. الحساب يوضح مسارين محددين؛ لا يستنتج مقدار تحيز تقييم أو تحسن دقة. وإذا تغير التقسيم أو سياسة الترميز، نعيد وصف أساس الرمز بدلا من نقل الجدول كما هو.

أي خريطة تبقى للصفوف اللاحقة؟

يوثق الدليل أن fit_transform يتعلم ويحفظ أيضا ترميزات كامل التدريب، بينما ترميزات الطيات الوسيطة مؤقتة؛ يستخدم transform الخريطة المحفوظة للبيانات اللاحقة. [2]

في حسابنا تكون خريطة الفئتين المعلومتين 13 و 22 لهذه الوظيفة، رغم أن تمثيل التدريب المعاد في المقارنة جاء من الطيات المانحة. إعادة تحويل التدريب بالخريطة المحفوظة لا تعيد تلقائيا المصفوفة المتقاطعة التي طلبناها أولا.

نسجل لذلك نوع الناتج وعضوية الطيات والإعداد والخريطة المحفوظة. ونفصل بين إعداد تمثيل التدريب وبين تحويل الاختبار بإحصاء التدريب؛ لا نستخدم أهداف الاختبار لتعلمه. تسمية الاثنين «بيانات مرمزة» وحدها تخفي اختلاف مصدر المعلومة.

المصادر ومتابعة القراءة

  1. scikit-learn: TargetEncoder (يفتح في نافذة جديدة)scikit-learn.org
  2. scikit-learn: target encoding in preprocessing (يفتح في نافذة جديدة)scikit-learn.org

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.