عدد الخصائص عند كل انقسام: مفتاح التنوع في الغابة
عدد الخصائص عند كل انقسام يحدد مجموعة المرشحين التي ينظر إليها بناء الشجرة عند البحث عن سؤال. يختلف ذلك عن حذف أعمدة من البيانات، أو فرض قائمة واحدة ثابتة على كل أشجار الغابة. [1]
قراءات عربية في العلوم والتقنية والطبيعة والثقافة، تبدأ بسؤال وتترك لك مساحة للاستكشاف.
2302 مقال
عدد الخصائص عند كل انقسام يحدد مجموعة المرشحين التي ينظر إليها بناء الشجرة عند البحث عن سؤال. يختلف ذلك عن حذف أعمدة من البيانات، أو فرض قائمة واحدة ثابتة على كل أشجار الغابة. [1]
في Extra Trees والعتبات العشوائية لا يقتصر الاختلاف على اختيار خصائص مرشحة. يدخل الاختيار العشوائي في عتبة الاختبار أيضًا، ثم تقارن الخوارزمية الانقسامات المرشحة وفق معيارها. [1]
تجميع الاحتمالات وتصويت الفئات طريقتان مختلفتان لتحويل مخرجات نماذج عدة إلى فئة واحدة. الأولى تحتفظ بقيم الاحتمال لكل فئة، والثانية تبدأ من اسم الفئة التي اختارها كل نموذج. [1]
التصويت المرجح للنماذج يعطي مخرجات بعض النماذج تأثيرًا أكبر عند الجمع. الوزن هنا يخص مساهمة نموذج في المجموعة، ويختلف عن وزن حالة تدريب أو وزن فئة داخل مصنف واحد. [1]
التكديس Stacking يدرب نموذجًا أخيرًا على مخرجات نماذج أساسية. بدل الاكتفاء بمتوسط ثابت، يتعلم المجمع علاقة بين هذه المخرجات والنتيجة المطلوبة. [1]
المزج Blending في البناء الموضح هنا يستعمل مجموعة حالات منفصلة لإنتاج مخرجات النماذج الأساسية التي يتعلم منها المجمع. توثق H2O هذا الدور عبر blending_frame. [1]
AdaBoost وأوزان الأمثلة يرتبطان بفكرة تدريب مصنفات متتابعة، مع تعديل وزن الحالات التي أخطأت مرحلة في تصنيفها كي تحصل على تركيز أكبر لاحقًا. [1]
التعزيز والغابات العشوائية قد يستعملان أشجارًا عدة، لكن طريقة إعدادها مختلفة. السؤال المفيد هنا: هل يحتاج تعلم المرحلة الجديدة إلى نتيجة ما سبقها، أم يستطيع بناء الشجرة من مادتها المحددة دون تصحيح خطأ شجرة سابقة؟
معدل التعلم في التعزيز يضرب مساهمة الشجرة الجديدة بمعامل قبل إضافتها إلى النموذج. توثق GradientBoostingRegressor علاقة ضبط بين هذا المعدل وعدد مراحل التعزيز. [1]
التوقف المبكر في التعزيز يراقب مقياسًا أثناء التدريب، ويوقف الإضافة حين لا يظهر تحسن مستوف للشروط خلال عدد جولات محدد. توثق XGBoost هذه الفكرة عبر early_stopping_rounds وخيارات المراقبة. [1]
يشرح XGBoost وتنظيم الأشجار فكرة اختيار تصحيح يقلل الخسارة مع احتساب تعقيد الأشجار. في الاشتقاق الموثق يستعمل تقريبًا من الدرجة الثانية للخسارة ومشتقاتها، لا أخطاء عددية غير موصوفة فقط. [1]
نمو LightGBM ورقة بعد ورقة يختار الورقة التي يحقق تقسيمها أكبر تغير مفيد في الخسارة، بدل اشتراط توسيع كل أوراق مستوى واحد معًا. قد ينمو فرع أكثر من فرع آخر. [1]
في CatBoost، لا يلزم تحويل أسماء الفئات إلى ترتيب عددي مصطنع. يدعم النموذج الخصائص الفئوية ويبني منها تمثيلات عددية، وقد يستخدم الترميز الأحادي داخليًا لفئات قليلة بحسب نمط التدريب. [1]
التعزيز بالمدرجات التكرارية يبحث الانقسامات عبر إحصاءات حزم تجمع القيم العددية. الحزم تقرب التمثيل؛ لا تحذف السجلات. [1]
القيود التفاعلية في التعزيز تحدد الخصائص المسموح أن تجتمع في مسار شجرة. يعرّف XGBoost هذا التفاعل عبر اختبارات تظهر معًا في الطريق إلى الورقة. [1]
انحدار الكميات بالتعزيز يختار مستوى كميًا بدل الاكتفاء بتقدير متوسط. يوضح مثال scikit-learn تدريب نماذج عند 0.05 و 0.5 و 0.95؛ المستوى الأوسط يستهدف الوسيط الشرطي. [1]
في التعزيز والبيانات الشاذة، لا يكفي عد الأخطاء؛ شكل الخسارة يحدد كلفتها. عندما تكون الفجوتان 1 و 6، ينتج التربيع 1 و 36، بينما ينتج أخذ المقدار المطلق 1 و 6. لذلك نحتاج فهم ما يطلب النموذج تقليله.
توازي أشجار الغابة سؤال عن الجدولة والموارد: أي أعمال يمكن تنفيذها معًا، وما الوقت الذي يضيفه تشغيلها وجمعها؟ وجود عدة أشجار لا يمنحنا وحده رقمًا للسرعة، ويجب التمييز بين خيار البرنامج وقياس الأداء على جهاز معين.