تقنية

وسيط الخطأ المطلق: كيف يظل ثابتًا رغم تضخم خطأ حالة؟

ست حالات تحتفظ بالوسطين بعد زيادة أكبر خطأ بينما يتغير المتوسط
الوسيط الثابت لا يضمن أن كل الأخطاء صغيرة.

وسيط الخطأ المطلق مقياس لتقييم الانحدار يختلف عن متوسطه. توثق الواجهة حسابه من الحقيقة والتنبؤ. [1] نستخدم ست حالات تعليمية لنرى ما يحفظه الرقم الوسطي وما قد يخفيه.

الخلاصة السريعة

احسب مقدار فرق كل تنبؤ عن حقيقته، ثم رتب المقادير وخذ وسيطها؛ في مثالنا الزوجي غير المرجح نأخذ متوسط المقدارين الثالث والرابع.

  • الشفرة الموثقة عند غياب أوزان الحالات تأخذ وسيط مقادير فروق التنبؤ عن الحقيقة، لا وسيط الحقائق أو فرق وسيطين. [2]
  • مقادير أخطائنا المرتبة 0 و 1 و 2 و 3 و 4 و 30 سم؛ الوسيط (2 + 3) ÷ 2 = 2.5 سم، رغم عدم وجود حالة خطؤها 2.5 بالضبط.
  • زيادة أكبر خطأ وحده من 30 إلى 90 تبقي الوسطين 2 و 3 والوسيط 2.5، بينما يرتفع متوسط المقدار من نحو 6.66667 إلى 16.66667 سم؛ الحالات الست محفوظة.
  • ثبات الوسيط لا يمحو الخطأ الكبير أو يشخصه شاذًا؛ اعرض حالاته وحجمها إذا كانت مهمة، ولا تجعل ملخصًا وسطيًا ضمانًا لكل تنبؤ.

أي قائمة تدخل عملية الوسيط؟

في شفرة scikit-learn1.7.2، الفرع غير المرجح يستخدم وسيط القيمة المطلقة لفروق التنبؤ عن الحقيقة. [2]

نقيم أطوال شرائط ورقية بست حالات، بالحقيقة والتنبؤ والوحدة نفسيهما. نحتاج إلى مقدار الخطأ لكل زوج أولًا. ترتيب الحقيقة وحدها يعطي وصفًا للأطوال، لا مقياسًا لمدى قرب التنبؤ منها. كما لا نطرح وسيط التنبؤ من وسيط الحقيقة ثم نسمي الناتج وسيط الخطأ المطلق.

حدد الوسط في ست مقادير

نعلن الحقائق 10 و 20 و 30 و 40 و 50 و 60 سم، والتنبؤات 10 و 21 و 32 و 43 و 54 و 90 سم. اخترناها للشرح؛ لا تصف تشغيل نموذج أو قياسات فعلية.

مقادير الفروق بالترتيب هي: 0، 1، 2، 3، 4، 30. نرتبها تصاعديًا؛ وهي مرتبة بالفعل في مثالنا. نستخدم مع العدد الزوجي متوسط مقدار الموضع الثالث ومقدار الرابع: (2 + 3) ÷ 2 = 2.5 سم.

لا نختار الموضع الثالث وحده فتكون النتيجة 2، ولا نحول الوسط إلى قيمة يجب أن تظهر في القائمة. متوسط الوسطين هنا 2.5 مع أن أيًا من الحالات الست لا يحمل هذا الخطأ بالضبط. العدد يلخص ترتيب المقادير، لا حالة سابعة مخفية.

غيّر الذيل مع حفظ الحالات

نبقي الحقائق والتنبؤات الخمسة الأولى، ونغير التنبؤ السادس من 90 إلى 150 سم. خطؤه يرتفع من 30 إلى 90 سم. تصبح المقادير 0 و 1 و 2 و 3 و 4 و 90؛ ما زال الثالث 2 والرابع 3، لذلك يبقى الوسيط 2.5.

لكن متوسط مقدار الخطأ كان (0 + 1 + 2 + 3 + 4 + 30) ÷ 6 = 40 ÷ 6، نحو 6.66667 سم. وأصبح 100 ÷ 6، نحو 16.66667 سم. تغير مقدار مساهمة الحالة الكبيرة في المجموع، بينما لم تنتقل مراكز الترتيب الوسطية.

لم نحذف الحالة السادسة أو نخفض وزنها بقرار تنظيف. هي ما زالت في القائمة، وقد تكون أهم الحالات للمهمة. النتيجة تفسر حدود ملخص وسطي، ولا تثبت أن الوسيط أفضل من المتوسط لكل استعمال.

ما التقرير الذي يمنع سوء القراءة؟

نحتفظ بالأخطاء الفردية والعدد والوحدة عند عرض الوسيط. إذا سأل الفريق عن أكبر خطأ في الشرائط، فالوسيط وحده لا يجيب؛ في المثال الثاني قد يسمع 2.5 دون أن يرى 90، فيستنتج قرب التنبؤات كلها من الحقيقة.

لا نقرر من حجم الخطأ أن حقيقة الشريط السادس خاطئة. قد يكون التقدير ضعيفًا أو تختلف الحالة، ونحتاج إلى مراجعة بياناتها إذا أردنا معرفة السبب. ثبات الوسيط عبر التغيير لا يثبت ثبات أداء كل الحالات.

الحساب غير مرجح وذو هدف واحد؛ أوزان الحالات قد تغير تعريف الوسط المستخدم في أداة. لم ننفذ الواجهة أو نختبر نظامًا، وإنما تابعنا تغير حالة مع بقاء ترتيب الوسطين. نوضح ما يلخصه المقياس ثم نضيف معلومات المهمة التي لا يحتويها الرقم.

المصادر ومتابعة القراءة

  1. scikit-learn: median_absolute_error (يفتح في نافذة جديدة)scikit-learn.org
  2. scikit-learn1.7.2 official regression code (يفتح في نافذة جديدة)raw.githubusercontent.com

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.