تقنية

تكلفة أخطاء التصنيف: لماذا قد يفوز القرار ذو الأخطاء الأكثر؟

ثلاثة أخطاء قد تكلف أكثر من أربعة عندما تختلف تكلفة النوعين
مجموع التكلفة لا يساوي عد الأخطاء.

تكلفة أخطاء التصنيف تحتاج إلى تعريف مقدار كل نوع خطأ ووحدته. يعرض المثال الرسمي ضرب أعداد مصفوفة الالتباس في تكاليف أو مكاسب معرفة، ثم جمع مساهماتها. [1]

الخلاصة السريعة

في مثال تعليمي بتكلفة ثابتة لكل خطأ وتكلفة صفر للصحيح، نجمع عدد الإيجابيات الكاذبة في تكلفتها وعدد الفائتات في تكلفتها؛ قد يختلف الأفضل عن أقل عدد أخطاء.

  • نحدد دقائق إعادة عمل افتراضية: دقيقتان لكل إيجابية كاذبة وسبع لكل فائتة، وصفر لكل قرار صحيح؛ ليست أوقاتًا قسناها في مشروع.
  • على الحالات الاثنتي عشرة نفسها، القرار أ يرتكب ثلاثة أخطاء، والقرار ب أربعة؛ الصحيح تسع حالات مقابل ثمان، دون اختلاف الحقيقة بين الجدولين.
  • بالتكاليف الثابتة المعلنة، مجموع أ هو 16 دقيقة ومجموع ب 13؛ المتوسط بقسمة كل مجموع على 12 لا يثبت توقعًا سكانيًا مضمونًا.
  • إذا غيرنا تكلفة الفائتة إلى دقيقة مع إبقاء تكلفة الإيجابية الكاذبة دقيقتين والصحيح صفرًا، تصبح أ أربع دقائق وب سبعًا؛ تفضيل القرار يتبع الافتراضات.

عرف التكلفة ووحدتها قبل الجمع

يجمع المثال الرسمي مساهمات أعداد الالتباس بعد ضربها في مقدار التكلفة أو المكسب المناسب لكل خانة. ويحدد إشارة المقياس بحسب كونه مكسبًا تعظمه الأداة. [1] نستخدم هنا تكلفة موجبة نريد تقليلها، دون نقل اصطلاح المكسب.

نتخيل قرارًا بشأن احتياج صندوق أدوات إلى جولة ترتيب إضافية. الإيجابية الكاذبة تعني جولة لم تكن مطلوبة، والفائتة تعني احتياجًا لم يختره القرار. لأغراض الحساب فقط نضع دقيقتين لإعادة العمل بسبب الأولى وسبعًا بسبب الثانية، وصفرًا للصحيح. ليست هذه قياسات زمنية أو توصية تنظيمية.

قارن عد الأخطاء على الحقيقة نفسها

لدينا اثنا عشر صندوقًا: أربعة تحتاج الجولة وثمانية لا تحتاجها. القرار أ يكتشف اثنين من الأربعة ويفوّت اثنين، ويضيف واحدًا من الثمانية خطأ. القرار ب يكتشف ثلاثة ويفوّت واحدًا، لكنه يضيف ثلاثة من غير المحتاجة.

إذن أ له ثلاث حالات خطأ وتسع صحيحة، وب له أربع حالات خطأ وثمان صحيحة. إذا كان هدفنا عدد الصحيح فقط، يتقدم أ. هذا ترتيب مختلف عن السؤال الذي سيطرح مجموع الدقائق.

الجدول من إعدادنا؛ لا يصف تشغيل نموذجين أو قياس زمن موظفين. الحالات والحقيقة ثابتتان، والتنبؤات المفترضة وحدها تختلف.

القرارTPFNFPTN
أ2217
ب3135

احسب مجموع الدقائق ومتوسط العينة

للقرار أ: 1 × 2 + 2 × 7 = 16 دقيقة. وللقرار ب: 3 × 2 + 1 × 7 = 13 دقيقة. لذلك يتقدم ب في هدف تقليل التكلفة المعلنة، رغم أن عدد أخطائه أكبر.

السبب أن ب استبدل فائتة واحدة بإيجابيتين كاذبتين إضافيتين: حذف سبع دقائق وأدخل أربعًا، فخفض المجموع ثلاث دقائق. لم تصبح الأخطاء صحيحة؛ اختلف مقدار ما نعده عند المقارنة.

القسمة على الاثنتي عشرة تعطي متوسط العينة: 16 ÷ 12، نحو 1.33333 دقيقة لأ، و 13 ÷ 12، نحو 1.08333 لب. لا نحول المتوسط إلى توقع مضمون لصناديق مستقبلية؛ توزيعها وتكاليفها قد يختلفان.

غيّر افتراضًا وشاهد تغير التفضيل

نبقي أعداد الجدول ونغير تكلفة الفائتة فقط إلى دقيقة واحدة. تظل الإيجابية الكاذبة دقيقتين والصحيح صفرًا. الآن أ يكلف 1 × 2 + 2 × 1 = 4 دقائق، وب يكلف 3 × 2 + 1 × 1 = 7 دقائق، فيتقدم أ.

إعلان الافتراض جزء من معنى النتيجة. لو اختلفت تكلفة الخطأ بين الصناديق أو ظهرت كلفة جماعية لا تتناسب مع عدد الحالات، فلن تكفي معاملاتنا الثابتة لوصف ذلك دون تعديل.

لم نشتق حد قرار أمثل أو توقعًا تجريبيًا. حفظنا الحقيقة وأعداد الأخطاء ثم غيّرنا السؤال الحسابي، لنوضح لماذا يجب عرض التكلفة ووحدتها وتكلفة الصحيح إلى جانب المقارنة، بدل اعتبار الأقل أخطاء أفضل لكل مهمة.

المصادر ومتابعة القراءة

  1. scikit-learn: cost-sensitive learning example (يفتح في نافذة جديدة)scikit-learn.org

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.