العينات خارج الحقيبة، أو OOB، هي الحالات التي لم تدخل عينة التدريب الخاصة بشجرة معينة. الحالة قد تكون غائبة عن شجرة وحاضرة في أخرى؛ الغياب وصف مرتبط بكل عينة على حدة. [1]
الخلاصة السريعة
لتقدير مخرج حالة بطريقة OOB، اجمع تنبؤات الأشجار التي لم تر تلك الحالة في عيناتها. لا تضم تنبؤ شجرة تدربت عليها إلى هذا التقدير. [1]
- نحدد الغياب لكل شجرة، ثم نجمع فقط تنبؤات الأشجار التي استبعدت الحالة من عيناتها. [1]
- في المثال، البطاقة 3 غابت عن الشجرة الأولى وحضرت في الثانية؛ الأولى وحدها تشارك في تقديرها خارج الحقيبة.
- تتطلب oob_score في RandomForestClassifier تفعيل bootstrap؛ مع قلة الأشجار قد لا تغيب حالة عن أي عينة ويظهر NaN. [2]
- تقدير استُعمل لاختيار الإعدادات لا يمثل تقييمًا نهائيًا مستقلًا عن ذلك الاختيار.
الخروج مرتبط بعينة واحدة
يشرح المثال الرسمي حساب خطأ OOB لكل حالة باستعمال تنبؤات الأشجار التي لا تحتوي عيناتها تلك الحالة. [1]
تخيل خمس بطاقات تحمل المعرفات 1 إلى 5. تدريب الشجرة الأولى يسحب [1، 1، 2، 4، 5]، والثانية يسحب [1، 2، 3، 3، 5]. كلتا العينتين تحتوي خمس سحوبات، لكن الأولى لا تحتوي 3، والثانية لا تحتوي 4. لا نسمي 3 غائبة عن تدريب الغابة كله؛ المقصود غيابها عن عينة الشجرة الأولى.
من يشارك في تقدير البطاقة؟
للبطاقة 3 نطلب تنبؤ الشجرة الأولى فقط من هاتين الشجرتين. الثانية رأتها مرتين أثناء التدريب، ولذلك لا تشارك في هذا التقدير. وللبطاقة 4 نعكس الدور: الثانية تشارك والأولى لا. هذه متابعة معرفات في مثال مصطنع، وليست قياسًا للدقة.
إذا أضاف البرنامج تنبؤات جميع الأشجار إلى كل بطاقة بلا مراجعة حضورها، فقد حسب تجميعًا عاديًا لا التقدير الذي نناقشه. اكتب بجانب كل تنبؤ عمود «هل حضرت الحالة في العينة؟». ثم اجمع القيم ذات الجواب لا. هذا الفحص يوضح السبب وراء اختيار الأشجار، بدل الاكتفاء باسم OOB في تقرير.
ماذا لو لم توجد شجرة مناسبة؟
توثق RandomForestClassifier أن oob_score متاح فقط مع bootstrap=True. ومع عدد صغير من الأشجار قد توجد حالة لم تُترك خارج أي عينة، فتتضمن oob_decision_function_ قيمة NaN. [2]
في مثال الشجرتين، البطاقة 1 حضرت في العينتين. لا يوجد لها تنبؤ خارج الحقيبة من هاتين الشجرتين. لا تستبدل الفراغ بتنبؤ تدريب ثم تقدمه على أنه OOB. راجع تغطية الحالات وتعريف التقرير في التنفيذ قبل تفسير رقم واحد ملخص. نقص التغطية يختلف عن تنبؤ خاطئ معروف يمكن مقارنته بالتسمية.
كيف نستخدم التقدير؟
يساعد التقدير في مقارنة سلوك إعدادات الغابة أثناء بنائها، بشرط توثيق الحالات والقاعدة التي جمع بها. وإذا نظرت إلى نتائجه مرارًا لاختيار عدد الأشجار أو الخصائص، صار جزءًا من عملية الاختيار. هذه ملاحظة منهجية عن استعمال النتيجة، لا ادعاء بتجربة منفذة.
احتفظ بوصف واضح لما اخترته بناء عليه، وافصل عنه تقييم القرار النهائي عند الحاجة إلى تقدير مستقل. لا تجعل عبارة «لم ترها هذه الشجرة» تعني «لم تؤثر في أي اختيار أجريته». يفيد OOB لأنه يستفيد من اختلاف عينات الأشجار، لكن معنى التقرير يتوقف أيضًا على الطريقة التي استخدمته بها.
المصادر ومتابعة القراءة
- scikit-learn: OOB Errors for Random Forests (يفتح في نافذة جديدة)scikit-learn.org
- scikit-learn: RandomForestClassifier (يفتح في نافذة جديدة)scikit-learn.org
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
