MAPE يقيس خطأ التنبؤ بصورة نسبية. ينبه التوثيق إلى تضخم الدرجة قرب حقيقة صفرية، وإلى أن مخرجه نسبي: قيمة 2 تقابل 200% وليست 2%. [1]
الخلاصة السريعة
اقسم مقدار خطأ كل حالة على مقدار حقيقتها قبل المتوسط، مع إعلان معالجة الصفر ووحدة المخرج؛ لا تساوي فروقًا مطلقة متساوية بنسب خطأ متساوية.
- مقام MAPE الموثق هو الأكبر بين مقدار الحقيقة وepsilon موجبة صغيرة؛ للحقيقة غير الصغيرة جدًا يصبح الحساب مقدار الخطأ مقسومًا على مقدارها. [2]
- للأطوال 0.05 و 5 و 50 سم، إذا زاد كل تقدير 0.5 سم، تكون نسب الخطأ 10 و 0.1 و 0.01؛ مقدار الخطأ متساو لكن وزنه النسبي مختلف.
- متوسط نسبنا الثلاث 3.37، أي 337%؛ خرج نسبي أكبر من واحد جائز، ولا نقرأه 3.37% أو نسبة حالات خاطئة.
- حقيقة صفرية قد تكون سجلًا صحيحًا؛ الواجهة تستخدم معالجة عددية تعطي قيمة كبيرة مع خطأ غير صفري، ولا يعني ذلك تعريف النسبة الرياضية عند الصفر أو إذن حذف الحالة.
المقام يخص حقيقة كل حالة
تعرض الصيغة متوسط مقدار الفرق مقسومًا على الأكبر بين epsilon موجبة ومقدار الحقيقة. [2] نركز على هدف واحد وحالات متساوية الوزن، ونبقي الحقيقة والتنبؤ بالوحدة نفسها.
الفرق نسبي إلى قيمة تلك الحالة، لا إلى متوسط المجموعة أو إلى التنبؤ. لو استعملنا التنبؤ مقامًا بدل الحقيقة، نكون قد عرفنا نسبة مختلفة. كذلك لا يلغي كون المقياس بلا وحدة ضرورة أن تكون النسبة ذات معنى مناسب لطبيعة الهدف.
ثلاثة مقامات وفجوة نصف سنتيمتر
ننشئ أطوالًا تعليمية 0.05 و 5 و 50 سم، وتقديرات 0.55 و 5.5 و 50.5 سم. زاد كل تقدير على حقيقته نصف سنتيمتر، دون اختلاف مقدار الخطأ المطلق.
في القيم التي تفوق حد المعالجة العددي، النسب هي 0.5 ÷ 0.05 = 10، و 0.5 ÷ 5 = 0.1، و 0.5 ÷ 50 = 0.01. الحالة الأولى تحمل نسبة أكبر ألف مرة من الأخيرة، رغم خطأ نصف السنتيمتر نفسه.
هذا يفسر لماذا لا تكفي مقارنة المتوسط النسبي دون مراجعة القيم الصغيرة. لا نقرر أن طول 0.05 خطأ إدخال أو أن التنبؤ كان أصعب؛ الحساب يوضح مقدار ما تمنحه الصيغة للخطأ في كل مقام.
افصل العدد النسبي من كتابة المئوية
المجموع النسبي 10 + 0.1 + 0.01 = 10.11، وقسمته على ثلاثة تعطي 3.37. ضربه بمئة يعطي 337%. هذه قراءة وحدتين لعرض الحساب نفسه، وليست درجة ثانية.
ينص المرجع على أن المخرج النسبي قد يكبر بلا حد مع تنبؤات سيئة أو حقيقة قريبة من الصفر. [1] لذلك لا نفترض أن كل رقم صادر يقع بين صفر وواحد، أو نقص القيمة إلى هذا المجال حتى يبدو كنسبة نجاح.
لا تعني 337% أننا أخطأنا في أكثر من عدد الحالات كلها. النسبة تصف متوسط مقادير نسب الفروق، ولا تعد الملصقات الصحيحة والخاطئة. نكتب اسم المقياس وصيغة العرض بجوار العدد قبل مقارنته بتقرير آخر.
الصفر يحتاج إلى سياسة معلنة
عند حقيقة صفر وتقدير 0.5، فإن قسمة 0.5 على مقدار الحقيقة وحده لا تعرف نسبة منتهية. أما الصيغة التي تحمل epsilon فتستخدمها مقامًا. لا تختار في تقريرك رقم epsilon من عندك ثم تنسبه إلى مكتبة لم تفحصها.
يوثق المرجع إعادة قيمة كبيرة بدل ما لا نهاية في حالات الحقيقة الصفرية. [1] لم نستدع الأداة أو ننسخ ناتجًا منها لحالتنا؛ ما شرحناه هو سبب حساسية المعالجة العددية، لا قيمة تنفيذية اختبرناها.
إذا كانت الأطوال الصفرية صحيحة في تعريف المهمة، لا نحذفها حتى ينخفض المقياس. نعلن أي تغيير في مجموعة التقييم ونراجع مقاييس حجم الخطأ أيضًا. المثال يميز مشكلة مقام من مشكلة صحة سجل، ولا يوصي بمقياس واحد لكل توزيع أو يعد مقارنة مجموعات مختلفة عادلة تلقائيًا.
المصادر ومتابعة القراءة
- scikit-learn: mean_absolute_percentage_error (يفتح في نافذة جديدة)scikit-learn.org
- scikit-learn: Model evaluation, MAPE formula (يفتح في نافذة جديدة)scikit-learn.org
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
