خط الأساس نتيجة حل بسيط نستخدمه مرجعا عند تقييم حل أكثر تعقيدا. ومن أمثلته مصنف يتجاهل ميزات الإدخال ويختار الفئة الأكثر تكرارا في بيانات التدريب. يفيد المرجع في معرفة ما أضافه النموذج، ولا يمثل وحده مستوى جودة مقبولا للخدمة. [1]
الخلاصة السريعة
حدد حلا بسيطا قابلا لإعادة المقارنة، ثم قيمه والنموذج على الحالات والمقاييس نفسها قبل نسبة التحسن إلى التعلم.
كيف يعمل مرجع بسيط للتصنيف؟
تصف scikit-learn أداة DummyClassifier بمرجع لمقارنة المصنفات، وتوضح أن توقعاتها تتجاهل قيم ميزات الإدخال. وفي خيار most_frequent تستخدم أكثر فئة ظهورا في تسميات التدريب. هذا لا يعني أنها لم تستعمل أي معلومة من البيانات. [1]
لنفترض بيانات تدريب افتراضية تضم نوعين من طلبات التغليف، وأن النوع العادي هو الأكثر تكرارا فيها. نحدد مرجعا يجيب «عادي» لكل طلب جديد. لا يفحص المرجع الوزن أو الأبعاد، لكنه يقدم نتيجة واضحة يمكن فحصها قبل صرف جهد على نموذج أكثر تعقيدا.
مثال حسابي يكشف ما تخفيه النسبة
افترض مجموعة تقييم مستقلة للتوضيح تضم 20 طلبا: 16 عاديا و4 تحتاج تغليفا خاصا. يجيب المرجع السابق «عادي» للجميع. سيصيب 16 من 20، أي 80%، لكنه لن يرصد أيا من الطلبات الأربعة الخاصة. النسبة هنا ناتج مثال اخترناه، وليست أداء أداة جُرّبت فعلا.
إذا كانت المهمة إعطاء تنبيه للحالات الخاصة، فلا يحقق المرجع هذا الغرض رغم صحة معظم الإجابات. تؤكد إرشادات Google أن نسبة التصنيفات الصحيحة وحدها قد تضلل عند عدم توازن الفئات أو اختلاف تكلفة الأخطاء. [2] احتفظ بالعدد العام وعدد الحالات المهمة المرصودة معا.
كيف نجعل المقارنة عادلة؟
استخدم مجموعة تقييم محددة للحلين، وتأكد من تعريف الفئات بالطريقة نفسها. في المثال، لا تختبر النموذج الجديد على طلبات سهلة فقط ثم تقارن نتيجته بنسبة المرجع على الطلبات العشرين الأصلية. تغير الحالات يغير السؤال الذي تجيب عنه المقارنة.
اكتب قاعدة المرجع ومصدر اختيارها وتاريخ نسخة البيانات. إذا تغير توزيع الفئات، فأعد تفسير المقارنة بدلا من نقل النسبة القديمة إلى السياق الجديد. ويمكن أن يكون خط الأساس قاعدة عملية متاحة حاليا، لا هذا المصنف تحديدا؛ المهم وضوح المرجع وقدرتك على إعادة تطبيق شروط المقارنة.
هل تجاوز المرجع يعني أن النموذج جاهز؟
تربط Google اختيار المقاييس بالمهمة وتكلفة أنواع الخطأ. [2] قد يزيد نموذج افتراضي عدد الإجابات الصحيحة، لكنه يفوّت حالة خاصة مهمة، أو يرسل تنبيهات كثيرة تعطل العمل. لا تكفي عبارة «أفضل من المرجع» دون تحديد ما تحسن وما ساء.
حدد مسبقا ما تحتاجه الخدمة: عدد الحالات الخاصة المرصودة، وحجم التنبيهات الخاطئة، وحدود القرار الذي سيعتمد على التوقع. مثال التغليف يساعد على طرح هذه الأسئلة، ولا يقدم معيار قبول عاما. خط الأساس نقطة بداية لفهم القيمة المضافة، ثم يأتي تقييم ملاءمة الحل للغرض الفعلي.
المصادر ومتابعة القراءة
- scikit-learn: DummyClassifier (يفتح في نافذة جديدة)scikit-learn.org
- Google: التصنيف، الدقة والاسترجاع والمقاييس ذات الصلة (يفتح في نافذة جديدة)developers.google.com
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
