تقنية

Log loss: لماذا تختلف خسارة قرارين صحيحين بالملصقات نفسها؟

مخرجان يصيبان ملصقي حالتين لكن احتمال الحقيقة الأعلى يعطي خسارة لوغاريتمية أصغر
تقييم الاحتمال يتجاوز عد الملصقات الصحيحة.

Log loss تقيم الاحتمال الذي يمنحه النموذج للحقيقة. يعرّف المرجع خسارتها الثنائية باستخدام اللوغاريتم الطبيعي لاحتمال الفئة الإيجابية ومتممه، لا بعد تحويل الاحتمال إلى ملصق فقط. [1]

الخلاصة السريعة

للحقيقة الثنائية واحتمال إيجابي بين صفر وواحد، نخسر سالب لوغاريتم الاحتمال المعطى للفئة الصحيحة؛ في مثالنا نأخذ متوسط خسارتين دون أوزان إضافية. [1]

  • إذا كانت الحقيقة إيجابية نحسب سالب اللوغاريتم الطبيعي للاحتمال الإيجابي، وإذا كانت سلبية نحسبه لمتمم الاحتمال، مع قيم داخل المجال المفتوح. [1]
  • احتمالا الإيجابي 0.6 و 0.4 لحقيقتين إيجابية وسلبية يعطيان متوسطًا نحو 0.51083؛ و 0.9 و 0.1 يعطيان نحو 0.10536، رغم صحة الملصقين عند حد 0.5.
  • لحقيقة إيجابية، احتمال 0.01 يخسر نحو 4.60517 واحتمال 0.4 نحو 0.91629؛ كلاهما يخطئ الملصق عند الحد نفسه، لكن ثقة الأول الخاطئة أشد.
  • الأداة تقص الاحتمالات عند حدود تعتمد على دقة نوع البيانات، والمتوسط يختلف عن المجموع؛ حسابنا اليدوي الداخلي لا يثبت معايرة الاحتمالات أو أداءً عامًا. [1]

ضع الاحتمال في الصيغة قبل الملصق

نرمز للحقيقة الإيجابية بواحد وللسلبية بصفر، ولاحتمال الإيجابي بالحرف p. الصيغة الثنائية هي سالب مجموع: الحقيقة مضروبة في لوغاريتم p، ومتمم الحقيقة مضروبًا في لوغاريتم متمم p. اللوغاريتم في التوثيق طبيعي أساسه e. [1]

نقصر الحساب اليدوي هنا على احتمال أكبر من صفر وأصغر من واحد. عند حقيقة واحدة يبقى سالب لوغاريتم p، وعند صفر يبقى سالب لوغاريتم (1 − p). يحتاج الحساب إلى احتمال الفئة الصحيحة، وليس إلى الرقم الذي يعبر عن الفئة المتنبأ بها فحسب.

قارن ملصقين ثابتين واحتمالين مختلفين

أنشأنا حالتين متساويتي الوزن: الأولى إيجابية والثانية سلبية. المخرج أ يمنح احتمال الإيجابي 0.6 للأولى و 0.4 للثانية. المخرج ب يمنح 0.9 للأولى و 0.1 للثانية. هذه احتمالات تعليمية، ولم نولدها من تدريب.

نعلن قرار الإيجابي عند احتمال أكبر من 0.5 أو مساويًا له. بهذا القرار يصيب المخرجان الحالتين نفسيهما، فلا يميز عد الصحيح بينهما.

لكن أ يمنح الحقيقة احتمال 0.6 في كل حالة، فتكون كل خسارة سالب لوغاريتم 0.6، نحو 0.51083، والمتوسط كذلك. وب يمنح الحقيقة احتمال 0.9 في كل حالة، فتكون الخسارة والمتوسط نحو 0.10536. اختلاف الدرجة جاء من الاحتمال، دون تغيير الملصق.

الخطأ الواثق ليس كخطأ أقل ثقة

في حالة ثالثة مستقلة للتوضيح، حقيقتها إيجابية، نقارن احتمالين إيجابيين 0.01 و 0.4. كلاهما دون العتبة المعلنة، فينتج ملصقًا سلبيًا خاطئًا.

الأول يعطي الحقيقة احتمالًا قليلًا جدًا: سالب لوغاريتم 0.01 نحو 4.60517. الثاني يعطيها احتمالًا أعلى: سالب لوغاريتم 0.4 نحو 0.91629. انخفاض احتمال الحقيقة يرفع عقوبتها في هذا التعريف، ولو بقي نوع خطأ الملصق نفسه.

لم نضم الحالة الثالثة إلى متوسط الحالتين السابق؛ إنها مقارنة منفصلة تحفظ اختلاف ما حسبناه. كما لا نستنتج من خطأ واحد أن نموذجًا بعينه سيخسر أكثر دائمًا على كل مجموعة.

اعرف حدود الأداة ومعنى التجميع

يوثق المرجع قص الاحتمالات إلى المجال بين eps و 1 − eps، حيث eps يتبع دقة نوع بيانات المخرج. ويتيح متوسط الخسارة أو مجموعها وفق خيار التطبيع. [1] لذلك قد تختلف معالجة الأطراف العددية عن حد الصيغة النظري.

قيمنا الداخلية لا تحتاج إلى بحث تلك الأطراف: حسبنا اللوغاريتم الطبيعي ثم المتوسط غير المرجح لحالتين. لو أخذنا المجموع بدل المتوسط لتضاعفت القيم، دون تغير الاحتمالات. لا نقارن رقمين قبل معرفة عدد الحالات وخيار التجميع.

لم نستدع واجهة تقييم ولم نثبت أن احتمال 0.9 يطابق تكرارًا فعليًا قدره 90%. النتيجة الصغيرة تقيس ما منحه المخرج للحقيقتين المعطاتين؛ معايرة الاحتمال وصلاحية الأداء لمجموعة أخرى سؤالان يحتاجان إلى تقييمهما.

المصادر ومتابعة القراءة

  1. scikit-learn: log_loss (يفتح في نافذة جديدة)scikit-learn.org

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.