تقنية

تجميع نماذج مختلفة: لماذا لا تكفي الدقة الفردية؟

دقةفردية 4من 6 تتفرع إلى اتفاقأخطاء ينتج 4من 6 ومواقعمنفصلةتنتج 6من 6
مواضع الأخطاء وقاعدة الجمع يفسران النتيجة في المثال.

عند تجميع نماذج مختلفة، لا يكفي أن تعرف عدد الإجابات الصحيحة لكل نموذج. نحتاج أيضًا مواضع أخطائها وقاعدة الجمع. سنثبت الفرق بمثال مصطنع فيه ثلاث نماذج متساوية الدقة الفردية، دون ادعاء أن تنوع أسماء الخوارزميات يضمن التحسن.

الخلاصة السريعة

في مثالنا، كل نموذج يجيب أربعًا من ست حالات صحيحة. إذا اشتركت النماذج في الخطأين، بقي خطأ الأغلبية؛ وإذا توزعت الأخطاء على حالات منفصلة، صححت الأغلبية الست. هذه نتيجة المثال بشروطه فقط.

  • عدد الصحيح لدى الفرد يخفي كيفية اجتماع الأخطاء؛ أثر التنوع ليس هدفًا نعظمه بلا مفاضلة. [1]
  • عندما تخطئ النماذج الثلاث في الحالتين نفسيهما، لا يصحح التصويت المتساوي ذلك الاتفاق الخاطئ.
  • عندما ينفرد كل نموذج بخطأين مختلفين، يوجد صوتان صحيحان بكل حالة في المثال، فتنجح الأغلبية.
  • الاختلاف مفيد إذا خدم قاعدة الجمع والنتيجة المطلوبة؛ لا تكفي أسماء نماذج مختلفة أو مجرد اختلاف المخرجات لضمان جودة جديدة.

ما الذي لا يخبرنا به رقم الفرد؟

تناقش دراسة منشورة في JMLR الاعتماد بين أعضاء المجموعة ومفاضلة الانحياز والتباين والتنوع، وتحذر من اعتبار تعظيم التنوع هدفًا منفردًا. [1]

إذا وصلتك بطاقة تقول «هذا النموذج أجاب 4 من 6 صحيحًا»، فهناك عدة قوائم أخطاء ممكنة تعطي الرقم نفسه. لا تستطيع معرفة ما سيصوت عليه الأعضاء مجتمعين من هذا العدد وحده. احتفظ بمعرف الحالة إلى جانب نتيجة كل عضو، ثم طبق قاعدة الجمع المعلنة.

اتفاق على الخطأ في المواضع نفسها

ننشئ ست حالات مرقمة، لها فئتان فقط أ وب، ونجمع ثلاثة أصوات بأوزان متساوية. نرمز للنماذج م 1 وم 2 وم 3. في الترتيب الأول، تخطئ كلها في الحالتين 1 و 2 وتجيب الحالات 3 إلى 6 صحيحة. كل عضو صحيح في أربع حالات، والأغلبية كذلك.

لتعيين الأخطاء دون غموض، نعني أن أي عضو مخطئ يعطي الفئة الأخرى غير الصحيحة؛ فلا توجد فئة ثالثة أو امتناع. لذلك تصبح الأصوات الثلاثة خاطئة ومتطابقة في 1 و 2. لا يستطيع عدد أصوات إضافي من المخرجات نفسها تصحيح هاتين الحالتين في هذا المثال.

الدقة نفسها مع توزيع آخر للأخطاء

في الترتيب الثاني، يخطئ م 1 في 1 و 2، وم 2 في 3 و 4، وم 3 في 5 و 6. كل عضو لا يزال صحيحًا في أربع حالات، لكن الخطأ الفردي لا يجتمع هنا مع خطأ عضو آخر في الصف نفسه. إذن يصوت عضوان للفئة الصحيحة في كل حالة.

نقارن مجموعتي أخطاء افتراضيتين، لا نتائج تدريب لخوارزميات مسماة. ولم نغير قاعدة التصويت. هذا يجعل سبب الفرق قابلًا للقراءة من الجدول، دون إسناده إلى اسم النموذج أو إلى تحسن غامض في البيانات.

الترتيبأخطاء م 1أخطاء م 2أخطاء م 3صحيح الأغلبية
اتفاق الخطأ1 و 21 و 21 و 24 من 6
أخطاء منفصلة1 و 23 و 45 و 66 من 6

كيف نحكم على الاختلاف الذي نريده؟

الشرط الحسابي المفيد هنا هو وجود صوتين صحيحين على الأقل في الحالة. مجرد وجود صوت مختلف لا يثبت ذلك: إذا كانت الحقيقة أ والأصوات أ وب وب، فهناك اختلاف، لكن الأغلبية ب خاطئة. لذلك يجب مقارنة الاختلاف بالحقيقة وقاعدة الجمع، لا وصفه بأنه مفيد تلقائيًا.

وفي تقرير فعلي، اعرض الحالات المشتركة التي أخطأ فيها الأعضاء، ثم نتيجة المجموعة على حالات جديدة. لا تنقل نجاح الست إلى ضمان عام. وقد تعطي خوارزميات من عائلات مختلفة أخطاء متشابهة في المهمة؛ اسم العائلة لا يحل محل جدول المخرجات. وللأوزان أو الامتناع أو الفئات المتعددة، أعد تعريف قاعدة الجمع قبل إعادة الاستنتاج.

المصادر ومتابعة القراءة

  1. Wood et al: A Unified Theory of Diversity in Ensemble Learning (يفتح في نافذة جديدة)jmlr.org

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.