تقنية

الفرق بين ID3 وC4.5: ما الذي تغير في تقسيم البيانات؟

السؤال المرشح يقارن بكسب المعلومات أو نسبة الكسب مع قيد الكسب قبل اختيار السؤال
نسبة الكسب تغير المقارنة؛ اختيار السؤال النهائي يحتاج بياناته.

الفرق بين ID3 وC4.5 يظهر في طريقة اختيار أسئلة الشجرة وأنواعها. يركز شرح ID3 الأصلي على كسب المعلومات، بينما تستخدم C4.5 نسبة الكسب وتبحث أيضًا عن حدود لخصائص عددية. [1][2]

الخلاصة السريعة

قارن معيار السؤال ونوع الخاصية وإعداد التقليم، بدل الحكم من الاسم وحده. المثال يوضح مشكلة كثرة قيم الخاصية دون تجربة أداء.

  • ينطلق ID3 من مقارنة كسب المعلومات؛ ويتناول المثال هنا هذا المعيار. [1]
  • تعدل نسبة الكسب المقارنة بحسب معلومات التقسيم، مع قيد على الكسب لتجنب تفضيل مقام صغير فقط. [2]
  • تبحث C4.5 عن عتبة للخاصية العددية؛ مثال طول الشريط يوضح الفرق عن سؤال القيم الفئوية. [2]
  • التقليم وإعدادات التنفيذ تؤثر في الشجرة؛ توثق Weka خيار C4.5 مقلم أو غير مقلم، ولا يضمن الاسم الأفضلية. [3]

أي معيار يستخدم السؤال؟

يشرح Quinlan بناء ID3 من تقسيم يحقق كسب معلومات مرتفعًا. [1]

للمقارنة التعليمية، تصور أنك ترتب بطاقات إلى نتيجة «أ» أو «ب». لكل بطاقة لون ورمز وطول شريط. المطلوب ليس استعادة رقم البطاقة، بل توقع النتيجة. لذلك نحتاج سؤالًا يميز النتائج مع بقاء معنى مفيد لحالات لم تُعرض. لا يجعلنا اسم الخوارزمية نعرف جودة السؤال قبل فحص ما يحسبه.

لماذا تختلف نسبة الكسب عن الكسب؟

في C4.5 تقسم نسبة الكسب كسب المعلومات على معلومات التقسيم، ثم تختار نسبة عالية بين أسئلة ذات كسب لا يقل عن المتوسط. هذا القيد يمنع الاكتفاء بنسبة مرتفعة ذات مقام صغير. [2]

في مثال مستقل، نفرض ثماني بطاقات لكل منها رمز فريد. السؤال عن الرمز يصنع ثمانية أجزاء مفردة ونقية. أما اللون فيصنع جزأين. كثرة نتائج الرمز يمكن أن تجعل كسبه جذابًا على بطاقات التدريب، لكنه يترك سؤالًا عمليًا: كيف نستعمل القاعدة مع رمز جديد؟

نسبة الكسب تغير موازنة الأسئلة؛ لا ندعي أنها ستختار اللون في مثالنا، لأننا لم نعط توزيع النتائج حسب الألوان. هذا النقص مقصود لتمييز شرح مشكلة المعيار عن الزعم بحساب قرار نهائي.

ماذا تضيف العتبة العددية؟

توثق ورقة C4.5 اختبار الخاصية العددية مقابل عتبة، بفرعين بحسب تحقق الاختبار. [2]

افترض أطوال شريط 2 و 3 و 7 و 8 سنتيمترات. يمكن لسؤال «هل الطول لا يزيد على 5؟» أن يفصل أول قيمتين عن الأخيرتين. هذه عتبة رسمناها للتوضيح، وليست قيمة توصلت إليها C4.5، إذ لم نقدم تسميات «أ» و«ب» المرتبطة بالأطوال.

قارن ذلك بسؤال فئوي «ما اللون؟» يسمح بنتيجة لكل لون مرشح. الخاصية العددية لها ترتيب يسمح بالتفكير في حد، أما الأحمر والأزرق فاسمان لا نضع بينهما 5 سنتيمترات. هذا هو الفرق الذي يريد المثال إبرازه، دون اختزال كل امتدادات ID3 في نسخة واحدة.

هل تكفي أسماء الخوارزميات للاختيار؟

توضح وثائق Weka أن J48 يولد شجرة C4.5 مقلمة أو غير مقلمة، وتعرض إعدادات للتحكم بالتقليم. [3]

عند قراءة مقارنة، اسأل أي تنفيذ وإصدار استُخدم، وكيف عولجت الخصائص، وما معيار التحقق. اختلاف الإعدادات قد يجعل اسمين في الجدول أقل إفادة من وصف طريقة البناء الفعلية. لا نستنتج أن C4.5 أفضل لكل بيانات لمجرد أنها تطوير لاحق.

هذا المقال يقارن اختيار أسئلة وبنيتها، ولا يغطي كل معالجة للقيم المفقودة أو كل تحديث تاريخي. إذا احتجت تلك التفاصيل، اقرأ وثائق التنفيذ المقصود ثم اختبر حالاتك. الأمثلة هنا مفترضة، ولم تُشغل مكتبة تدريب أو تُقاس دقة نموذج.

المصادر ومتابعة القراءة

  1. Quinlan1986: Induction of Decision Trees (يفتح في نافذة جديدة)storm.cis.fordham.edu
  2. Quinlan1996: Improved Use of Continuous Attributes in C4.5 (يفتح في نافذة جديدة)arxiv.org
  3. Weka: J48 (يفتح في نافذة جديدة)weka.sourceforge.io

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.