الغابة العشوائية: كيف تتعاون أشجار مختلفة على التنبؤ؟
الغابة العشوائية تجمع تنبؤات أشجار قرار متنوعة في نتيجة واحدة. في طريقة شائعة، تختلف الأشجار في أمثلة التدريب والخصائص المتاحة عند الانقسام، لتقليل تشابه أخطائها. [1]
أفكار وأدوات رقمية بلغة مفهومة.
1201 مقال
الغابة العشوائية تجمع تنبؤات أشجار قرار متنوعة في نتيجة واحدة. في طريقة شائعة، تختلف الأشجار في أمثلة التدريب والخصائص المتاحة عند الانقسام، لتقليل تشابه أخطائها. [1]
التعزيز التدريجي، أو تعزيز التدرج، يبني نموذجًا بإضافة نماذج صغيرة بالتتابع لتحسين التنبؤ. تعتمد الإضافة الجديدة على أداء المجموعة السابقة، وغالبًا تكون النماذج المضافة أشجار قرار. [1]
آلة المتجهات الداعمة، واختصارها SVM، طريقة تعلم تستخدم للتصنيف وغيره. في التصنيف تحاول بناء حد يفصل الفئات مع موازنة هامش الفصل وأخطاء التدريب. [1]
خوارزمية أقرب الجيران، واختصارها KNN، تتنبأ من أمثلة تدريب قريبة من حالة جديدة بحسب مقياس مسافة. تستخدم فئات الجيران للتصنيف، أو قيمهم العددية للانحدار. [1]
بايز الساذج عائلة مصنفات تستخدم قاعدة بايز مع افتراض مبسط: تُعامل الخصائص بوصفها مستقلة عن بعضها عند معرفة الفئة. هذا استقلال مشروط، وليس ادعاءً أن الخصائص مستقلة في كل البيانات. [1]
خوارزمية K-means تجمع البيانات في عدد مجموعات تحدده مسبقًا. تكرر إسناد كل نقطة إلى أقرب مركز، ثم تحديث المركز بمتوسط نقاط مجموعته، حتى تستوفي شرط التوقف. [1]
خوارزمية DBSCAN تجمع النقاط التي تكوّن مناطق كثيفة متصلة، ويمكن أن تترك نقاطًا خارج المجموعات بوصفها ضوضاء. لا تطلب منك تحديد عدد المجموعات مسبقًا، بل إعدادات للجوار والكثافة. [1]
عمق شجرة القرار هو أطول مسار بين الجذر وأي ورقة. ويضع إعداد max_depth سقفًا لنموها، لكنه لا يجبرها على بلوغ هذا السقف. [1]
تقليم شجرة القرار يزيل أجزاء من شجرة بُنيت بالفعل. أما الحد من النمو فيمنع بعض الفروع أثناء التدريب، مثل وضع سقف للعمق. الطريقتان تتحكمان في التعقيد في مرحلتين مختلفتين. [1]
مقياس جيني في أشجار القرار يصف اختلاط فئات الأمثلة داخل عقدة. في الحالة الثنائية نحسبه بطرح مجموع مربعي نسبتي الفئتين من الواحد. انخفاضه يعني اختلاطًا أقل، ولا يمثل وحده دقة النموذج. [1]
كسب المعلومات في شجرة القرار هو انخفاض إنتروبيا الفئات بعد تقسيم الأمثلة: قيمة العقدة الأصلية ناقص مجموع قيم الأجزاء المرجح بأحجامها. يساعد هذا المعيار على مقارنة أسئلة مرشحة. [1]
شجرة الانحدار تنتج قيمة عددية عند الورقة. في DecisionTreeRegressor مع معيار squared_error، تتعلم الورقة متوسط قيم أهداف أمثلة التدريب التي وصلت إليها. أما معيار absolute_error فيستخدم الوسيط. [1]
أقل عدد من العينات في الورقة قيد على حجم الأجزاء التي يسمح بها انقسام شجرة القرار. في scikit-learn، لا يقبل الانقسام إلا إذا أبقى الحد المطلوب في كل من الفرعين. [1]
شجرة CART، اختصار أشجار التصنيف والانحدار، تبني تقسيمات ثنائية متكررة: يقسم اختبار البيانات إلى جزأين، ثم تطبق الفكرة داخل الأجزاء. الثنائية تصف التفرع، ولا تحصر المهمة في فئتين. [1]
الفرق بين ID3 وC4.5 يظهر في طريقة اختيار أسئلة الشجرة وأنواعها. يركز شرح ID3 الأصلي على كسب المعلومات، بينما تستخدم C4.5 نسبة الكسب وتبحث أيضًا عن حدود لخصائص عددية. [1][2]
الانقسامات المائلة في أشجار القرار تختبر أكثر من خاصية في السؤال نفسه. أما الانقسام المحاذي للمحور فيستعمل خاصية واحدة. [1]
شجرة القرار والبيانات الناقصة تحتاجان قاعدة لتحديد الفرع عندما تغيب قيمة خاصية. توجد طرق تتعلم اتجاه النقص عند العقدة، وطرق تستعين باختبار بديل. طريقة التنفيذ هي التي تحدد السلوك. [1][2]
الشجرة الرتيبة تقيد اتجاه تغير التنبؤ عند تغير خاصية معينة مع ثبات بقية الخصائص. الاتجاه المتزايد يعني ألا ينخفض التنبؤ، وقد يبقى ثابتًا. [2]