انحدار الكميات بالتعزيز يختار مستوى كميًا بدل الاكتفاء بتقدير متوسط. يوضح مثال scikit-learn تدريب نماذج عند 0.05 و 0.5 و 0.95؛ المستوى الأوسط يستهدف الوسيط الشرطي. [1]
الخلاصة السريعة
تغيير مستوى الكمية يغير هدف الخسارة. يمكن الجمع بين تقديري 0.05 و 0.95 في نطاق بتغطية اسمية 90%، لكن التغطية الفعلية تحتاج فحصًا. [1]
- المستوى 0.5 يستهدف الوسيط الشرطي، الذي لا يساوي المتوسط الشرطي بالضرورة. [1]
- تعاقب خسارة pinball التقليل والزيادة بمعاملين مختلفين عند مستوى غير 0.5؛ مقدار الخطأ وحده لا يكفي. [3]
- مثال المستوى 0.8 يعطي خطأين متساويين في الحجم خسارتين 1.6 و 0.4؛ هذا حساب توضيحي وليس تدريبًا.
- حدا 0.05 و 0.95 لا يضمنان وقوع كل نتيجة بينهما؛ قس التغطية على حالات جديدة ولا تسم النطاق أصغر وأكبر قيمة ممكنة. [1]
ما الهدف الذي يتعلمه النموذج؟
يعرض المثال نماذج تعزيز للكميات الشرطية، ويفصل بينها وبين نموذج المربعات الصغرى للمتوسط. يمكن أن تختلف قيمة الوسيط عن المتوسط مع توزيع غير متماثل. [1]
كلمة «شرطي» تعني أننا نسأل عن النتائج المرتبطة بخصائص معينة، لا عن رقم واحد لكل الحالات بلا اعتبار لمدخلاتها. عند كتابة تقرير، اذكر المستوى مع التقدير: تقدير عند 0.8 غير تقدير عند 0.5، حتى لو خرجا في حالة معينة بالعدد نفسه. تطابق عددين لا يوحد الهدفين.
كيف تدخل جهة الخطأ؟
في حساب pinball، إذا كانت القيمة الحقيقية أعلى من التقدير، تضرب الفجوة في alpha؛ وإذا كانت أدنى، تضرب حجم الفجوة في 1-alpha. هذه قراءة للصيغة في التنفيذ الرسمي. [3]
يوضح مرجع المقياس أن alpha=0.95 يرتبط باستهداف الكمية الخامسة والتسعين. لا يعني ذلك أن خسارة حالة واحدة تساوي احتمالها، ولا أن 0.95 شهادة على دقة كل تنبؤ. [2]
حساب صغير لمستوى 0.8
ننشئ حالتين مصطنعتين لهما تقدير 10. القيمة الحقيقية للأولى 12، فيكون التقليل بمقدار 2، والخسارة 0.8×2=1.6. القيمة الحقيقية للثانية 8، فيكون التقدير زائدًا بمقدار 2، والخسارة (1-0.8)×2=0.4.
الحجم المطلق للخطأ متساو، لكن الكلفة ليست متساوية عند هذا المستوى. إذا كانتا الحالتين الوحيدتين وبوزن متساو، يكون المتوسط (1.6+0.4)/2=1.0. تغير الوزن أو إضافة حالات سيغير المتوسط؛ لا تجعل هذا الرقم نتيجة عامة لخوارزمية التعزيز.
ولو استعملنا 0.5 في الحساب نفسه، لصارت خسارة كل حالة 1.0. هذا يبين التماثل الحسابي عند المستوى الأوسط. لم نغير القيم الحقيقية، ولم ندع أن نموذجًا تعلم التقدير 10. نحن نفصل وظيفة الخسارة عن عملية العثور على نموذج يقللها عبر حالات التدريب.
كيف نقرأ نطاقًا بين كميتين؟
يفرق المثال الموثق بين تغطية النطاق الكمي وبين مستوى الثقة في تقدير تغطيته؛ وقد تفشل التغطية المستهدفة على الاختبار. [1]
إذا افترضنا حدين متعلمين 7 و 14 لحالة، فهما تقديران لا وعد بأن القيمة التالية ستقع بينهما. لا تصفهما بأنهما الحد الأدنى والأقصى الممكنان. سجل مدى وقوع النتائج الجديدة داخل نطاقاتها، وافحص إن كانت هناك مجموعات محددة يضعف فيها الأداء؛ نجاح إجمالي لا يشرح كل مجموعة منفردة.
المصادر ومتابعة القراءة
- scikit-learn: Prediction Intervals for Gradient Boosting Regression (يفتح في نافذة جديدة)scikit-learn.org
- scikit-learn: mean_pinball_loss (يفتح في نافذة جديدة)scikit-learn.org
- scikit-learn official implementation: mean_pinball_loss (يفتح في نافذة جديدة)github.com
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
