تقنية

التعلم النشط: هل يختار الهامش والإنتروبيا الحالة نفسها؟

مقارنة هامشي حالتين ينتهي فيها معيار الهامش إلى أ ومعيار الإنتروبيا إلى ب دون معرفة الوسم الصحيح
مقارنة تحريرية بأرقام معلنة؛ لا نتيجة نموذج شغلناه.

عند مقارنة الهامش والإنتروبيا في التعلم النشط، اسأل أولًا عن العدد الذي ترتبه. قد تتقارب أعلى فئتين في حالة، بينما تتوزع كتلة الاحتمالات على فئات أكثر في أخرى. نكتب احتمالين ثلاثيين ونقرأ قرار طلب الوسم تحت معيارين، دون افتراض أن أي طلب منهما سيحسن نموذجًا.

الخلاصة السريعة

قد يختلف الاختيار: الهامش ينظر إلى الفرق بين أعلى احتمالين، والإنتروبيا تلخص التوزيع كله. في ورقتنا يختار الهامش أ والإنتروبيا ب.

  • تختار margin_sampling أصغر هامش بين أعلى احتمالين، بينما تختار entropy_sampling أكبر إنتروبيا. [1] نقارن المعيارين على الحالات نفسها.
  • أ لها احتمالات 0.5 و 0.49 و 0.01، وهامش 0.01؛ ب لها 0.6 و 0.2 و 0.2، وهامش 0.4. طلب الهامش في الورقة يختار أ.
  • نحسب الإنتروبيا باللوغاريتم الطبيعي لجميع الفئات: أ نحو 0.74217 وب نحو 0.95027؛ طلب الإنتروبيا يختار ب، ولا تكفي مقارنة أعلى احتمالين.
  • الاختيار طلب وسم تحت معيار، لا معرفة للفئة الصحيحة أو دليل معايرة أو تحسن لاحق؛ الاحتمالات مؤلفة ولم نشغل متعلمًا نشطًا.

ما الذي يرتبه كل معيار؟

في الشيفرة الموثقة تختار margin_sampling أقل فرق بين أعلى احتمالين، وتختار entropy_sampling أكبر إنتروبيا للتوزيع. [1]

نحصر المقارنة في طلب حالة واحدة من حالتين لم نعرف وسميهما. نعطي كل حالة احتمالات الفئات الثلاث ألوانًا سميناها أحمر وأخضر وأزرق. ترتيب أسماء الفئات ثابت بين الحالتين، لكن أسماء الحالتين أ وب لا تشير إلى لون صحيح.

لا نعتمد على كلمة «حيرة» وحدها، لأنها قد تصف أكثر من عدد. نكتب تعريف المعيار بجانب بطاقة الطلب قبل ترتيب الحالات؛ عندها يصبح الاختلاف المحتمل قابلًا للحساب، بدل اعتباره خطأ في واحدة من الطريقتين.

أي حالة تتقدم تحت الهامش؟

نؤلف للحالة أ التوزيع 0.5 و 0.49 و 0.01. مجموع الأرقام واحد، وأعلى احتمالين 0.5 و 0.49. الفرق بينهما 0.01. وللحالة ب نعطي 0.6 و 0.2 و 0.2؛ مجموعها واحد أيضًا وهامشها 0.4.

مع اختيار الهامش الأصغر، تتقدم أ في قائمتنا. الفرق بين أقوى فئتين فيها صغير جدًا؛ لو نظرنا إلى هاتين الفئتين وحدهما لظهر تردد متقارب بين اللونين الأولين. لا نحتاج معرفة اللون الصحيح كي نحسب هذا الفرق.

لكن الاحتمال الثالث في أ لم يدخل عملية الطرح، رغم وجوده في البطاقة. ذلك ليس حذفًا من توزيعها الأصلي، بل نتيجة تعريف المعيار الذي اخترناه. نحفظ الأرقام الثلاثة حتى نستطيع لاحقًا مراجعة معيار يتناولها جميعًا.

لماذا تتقدم ب تحت الإنتروبيا؟

دالة الإنتروبيا في التنفيذ تستعمل إنتروبيا احتمالات الفئات، لا طرح أكبر احتمالين. [1]

نعلن في حسابنا استعمال اللوغاريتم الطبيعي، ونحسب سالب مجموع حاصل كل احتمال في لوغاريتمه. كل احتمال في البطاقتين موجب. تعطي أ نحو 0.74217، وتعطي ب نحو 0.95027. لذلك أكبر إنتروبيا بينهما تخص ب.

ب تحتفظ بكتلة 0.4 موزعة على الفئتين الثانية والثالثة. أما أ فتحمل 0.99 في فئتين و 0.01 فقط في الثالثة. لا ينتج ترتيب الإنتروبيا من فرق القمتين وحده، ولا نجعل الأعداد السابقة نسبة مئوية لصحة الوسم. الأرقام تقريب لحساب معلن، وليست درجة أخرجتها مكتبة.

هل طلب الحالة يثبت أن وسمها معروف؟

يمكن تدوين «اطلب وسم أ تحت الهامش» أو «اطلب وسم ب تحت الإنتروبيا». لا يجوز ملء خانة اللون الصحيح من الجملة؛ هدف الطلب الحصول على معلومة لم نعلنها، لا إعادة تسمية أكبر احتمال بأنه مرجع متحقق.

كذلك لم نفحص معايرة الاحتمالات أو تمثيل الحالات لبقية المهمة، ولم ندرب نسخة بعد وصول الوسم. لا تبرهن المقارنة أن أحد المعيارين أفضل دائمًا، أو أن طلبًا معينًا سيخفض الخطأ بمقدار معلوم. ترتيبهما المختلف هو النتيجة التي أثبتها مثالنا.

للمراجعة احتفظ بالتوزيع الكامل وتعريف المعيار وقيمة ترتيبه وهوية الحالة المطلوبة، ثم سجل الوسم ومصدره حين يصل. افصل مرحلة الاختيار عن تقييم أثر التعلم اللاحق. هذه ورقة قرار قابلة للفحص، دون تنفيذ طلب وسم أو تجربة تدريب.

المصادر ومتابعة القراءة

  1. modAL: uncertainty query strategies implementation (يفتح في نافذة جديدة)modal-python.readthedocs.io

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.