يدرب OneVsRestClassifier مصنفًا لكل فئة مقابل بقية الفئات، بينما ينشئ OneVsOneClassifier مصنفًا لكل زوج فئات. [1] [2]
الخلاصة السريعة
تختلف المسائل الثنائية التي يبنيها الأسلوبان؛ عدد المصنفات وحده لا يحدد الزمن أو جودة القرار النهائي.
- في المهمة ذات الفئة الواحدة لكل مثال، يقابل واحد ضد الباقي كل فئة ببقية الفئات؛ عدد مصنفاته يساوي عدد الفئات. [1]
- لأربع فئات، نحصل على أربع مسائل ضد الباقي وست مسائل زوجية، بمجموعات تدريب مختلفة في المثال.
- الفائز ج في مثال الأصوات الزوجية نتيجة انتصارات افترضناها صراحة؛ ليست تنبؤات نموذج جرى تدريبه.
- عند تعادل الأصوات الزوجية، يستعمل تنفيذ scikit-learn درجات الثقة في التجميع؛ الأصوات المتساوية وحدها لا تكفي لتسمية الفائز. [2]
أي مسألة ثنائية نبني أولًا؟
نفترض أن كل مثال يحمل فئة واحدة من أ وب وج ود. في مسألة أ ضد الباقي، التسمية الثنائية هي «أ» أو «واحدة من ب وج ود». في مسألة أ ضد ب، نستبعد أمثلة ج ود من هذه المقارنة.
لهذا لا يعني ظهور اسم أ في مصنفين أن المصنفين يريان البيانات والتسميات الثنائية نفسها. احتفظ بأسماء الفئات الداخلة في كل مسألة قبل قراءة خرجها.
لا نعالج هنا ملفًا يسمح بعدة تسميات مستقلة للمثال نفسه. تغيير هذا الشرط يغير معنى جمع القرارات؛ فلا نعرض المهمة متعددة الفئات وكأنها مجرد وضع علامات اختيار متعددة دون تحديد.
أربع فئات لا تعني أربع مسائل دائمًا
يوثق الأسلوب الزوجي عددًا مقداره n×(n−1)/2 من المصنفات، مع تدريب كل منها على الفئتين المعنيتين. [2]
عند n=4، الأزواج هي أ/ب وأ/ج وأ/د وب/ج وب/د وج/د: ستة، مقابل أربعة مصنفات ضد الباقي. نفترض مثالين تدريبيين لكل فئة، فيكون مجموع الملف ثمانية أمثلة.
مسألة أ ضد الباقي ترى مثالين من أ وستة من غير أ. ومسألة أ ضد ب ترى مثالين من كل فئة، أي أربعة إجمالًا. هذا عد لمجموعات مفترضة، لا قياس زمن. عدد ستة بدل أربعة لا يثبت أن التدريب أبطأ لأن حجم كل مسألة ومصنفها يهمان أيضًا.
كيف تقرأ جدول انتصارات زوجية؟
نفترض أن الفائز في أ/ب هو أ، وفي أ/ج هو ج، وفي أ/د هو أ، وفي ب/ج هو ج، وفي ب/د هو ب، وفي ج/د هو ج.
نجمع انتصارات الفئات: أ تحصل على اثنين، وب على واحد، وج على ثلاثة، ود على صفر. وفق هذه الأصوات، ج هي صاحبة العدد الأكبر. لم نقس احتمال ج، ولم نقارنها بتسمية حقيقية لحالة اختبار.
كتابة الأزواج تمنع خطأ عد فوز ج في أ/ج لصالح أ لأن أ جاءت أولًا في اسم الزوج. ارجع إلى هوية الفائز، ثم اجمع. هذه نتائج افتراضية لشرح التجميع، وليست درجات أو انتصارات مستخرجة من تدريب فعلي.
ماذا يحدث إن تساوت الأصوات؟
ينص توثيق OneVsOneClassifier على إضافة تحويل لدرجات الثقة الزوجية إلى الأصوات لحسم حالات التعادل في دالة القرار. [2]
نفترض ثلاث فئات فقط: أ تفوز على ب، وب على ج، وج على أ. تحصل كل فئة على صوت واحد. لم نعط درجات الثقة، ولذلك لا نحدد الفائز النهائي من هذا الجدول وحده.
اقرأ قاعدة التجميع الخاصة بالتنفيذ بدل إعلان أن التعادل يختار دائمًا أول فئة. وإذا قارنت الأسلوبين على مهمة فعلية، سجل المصنف الثنائي والإعدادات والنتائج المقاسة؛ لا يستنتج مثالنا أفضلية عامة أو عدد ثوان من صيغة عدد الأزواج.
المصادر ومتابعة القراءة
- scikit-learn: OneVsRestClassifier (يفتح في نافذة جديدة)scikit-learn.org
- scikit-learn: OneVsOneClassifier (يفتح في نافذة جديدة)scikit-learn.org
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
