تقنية

استقرار شجرة القرار: لماذا تتغير الفروع مع عينة إضافية؟

ثلاث بطاقات تعطي فصلًا كاملًا لسؤالي اللون والشكل، ثم بطاقة رابعة تبقي فصل الشكل فقط
تغير البيانات يغير منافسة الأسئلة حتى مع ضبط العشوائية.

استقرار شجرة القرار يعني هنا مدى تغيرها عند تغير بيانات التدريب قليلًا. تناقش دراسة Bagging Predictors حساسية أشجار التصنيف والانحدار لهذه التغيرات. [1]

الخلاصة السريعة

افحص تغيّر المسارات والتنبؤات عند تغير العينة. قد يتبدل السؤال الأول بسبب منافسة متقاربة، ولا يعني تثبيت العشوائية أن بيانات جديدة ستنتج الشجرة نفسها.

  • تغير صغير في بيانات التدريب قد يؤدي إلى تغير كبير في شجرة مستخرجة؛ ليس لازمًا في كل حالة. [1]
  • في مثالنا، سؤالان يفصلان ثلاث بطاقات تمامًا، ثم بطاقة رابعة تجعل أحدهما أوضح للفصل.
  • تثبيت random_state يضبط مصدر العشوائية في البناء؛ لا يثبت محتوى العينة. [2]
  • ميّز اختلاف الرسم عن اختلاف التنبؤ، وراجع الحالات التي انتقلت بين المخرجات.

ما الذي يمكن أن يتغير؟

تصف دراسة Breiman طرقًا غير مستقرة تتغير نتائجها كثيرًا مع تغير صغير في مجموعة التدريب، وتذكر أشجار التصنيف والانحدار ضمنها. [1]

قد نرى سؤالًا جديدًا عند الجذر أو حدًا مختلفًا في فرع أو تغيرًا في ورقة. لا يكفي القول إن عدد العقد بقي نفسه لإثبات استقرار التفسير. وفي المقابل، تغير اسم السؤال لا يثبت وحده أن كل تنبؤ تغير؛ تحتاج إلى مقارنة الحالات نفسها بين النسختين.

مثال: كيف تكسر بطاقة واحدة تعادلًا؟

نفترض ثلاث بطاقات لها اللون والشكل والفئة. البطاقة 1 حمراء ودائرية وفئتها أ. البطاقة 2 زرقاء ومربعة وفئتها ب. البطاقة 3 حمراء ودائرية وفئتها أ. سؤال «هل اللون أحمر؟» وسؤال «هل الشكل دائري؟» يفصلان أ عن ب تمامًا على هذه البطاقات. لا تحدد هذه المعطيات وحدها أي السؤالين سيختاره تنفيذ بعينه.

نضيف بطاقة 4 حمراء ومربعة وفئتها ب. أصبح سؤال اللون يضع بطاقة ب مع بطاقتي أ في فرعه الأحمر، بينما يحافظ سؤال الشكل على فصل أ الدائرية عن ب المربعة. فإذا كان الاختيار بين هذين السؤالين على أساس فصل الفئات، تغيرت المنافسة لصالح الشكل. هذا مثال منطقي مصطنع لا تجربة تدريب ولا دليلًا أن اللون أو الشكل يسبب الفئة.

البطاقةاللونالشكلالفئة
1أحمردائريأ
2أزرقمربعب
3أحمردائريأ
4: المضافةأحمرمربعب

هل تكفي بذرة عشوائية ثابتة؟

يوثق وصف DecisionTreeRegressor تثبيت random_state لنتيجة بناء حتمية عند ضبط مصدر العشوائية، ويذكر الاختيار بين انقسامات متساوية التحسين. [2]

هذا يجيب عن إعادة البناء على المدخلات والإعدادات نفسها. في مثالنا أصبحت مجموعة البطاقات أربعًا بعد أن كانت ثلاثًا؛ تغيرت معلومات الفصل نفسها. لذلك لا تطلب من البذرة أن تمنع الاختلاف الذي سببه تغيير البيانات. احتفظ بالنسختين وبوصف ما أضفته لتعرف أي نوع من التغير تقارن.

كيف نراجع اختلاف نسختين؟

ضع بطاقات مراجعة ثابتة أمام الشجرتين، واكتب السؤال الأول والمسار والمخرج لكل بطاقة. افصل تغير ترتيب الأسئلة عن انتقال البطاقة من أ إلى ب. يمكنك اقتراح جدول «نفس المخرج، مسار مختلف» و«مخرج مختلف»، لأن كليهما يخدم سؤال مراجعة مختلفًا.

وعند شرح القرار احتفظ بنسخة الشجرة التي أنتجته. لا تستخدم القاعدة الجديدة لشرح جواب قديم لمجرد أن النموذجين يحملان الاسم نفسه. ناقش أثر الاختلاف على المهمة قبل اعتباره فشلًا أو تحسنًا؛ المثال يعلمنا كيف تتحرك المنافسة بين الأسئلة، ولا يمنح نسبة عامة للاستقرار.

المصادر ومتابعة القراءة

  1. Leo Breiman: Bagging Predictors (يفتح في نافذة جديدة)stat.berkeley.edu
  2. scikit-learn: Decision Tree Regression (يفتح في نافذة جديدة)scikit-learn.org

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.