التعزيز والغابات العشوائية قد يستعملان أشجارًا عدة، لكن طريقة إعدادها مختلفة. السؤال المفيد هنا: هل يحتاج تعلم المرحلة الجديدة إلى نتيجة ما سبقها، أم يستطيع بناء الشجرة من مادتها المحددة دون تصحيح خطأ شجرة سابقة؟
الخلاصة السريعة
في التعزيز التدرجي تعتمد مادة المرحلة على النموذج المتراكم قبلها. في الغابة تنمو الأشجار وفق عيناتها وعشوائيتها دون هذا التصحيح المتتابع. اعتماد التدريب يختلف عن ترتيب حساب المخرجات وقت التنبؤ. [1] [2]
- تضيف خوارزمية التعزيز التدرجي مراحل، وتتعلم أشجار المرحلة من التدرج السالب للخسارة الحالية. [1]
- تصف الدراسة بناء كل شجرة بمتجه عشوائي مستقل؛ ولا يعني ذلك استقلال تنبؤات الأشجار إحصائيًا. [2]
- التتابع في التعلم لا يعني أن التنبؤ الجديد يحتاج نتائج تدريب جديدة؛ النموذج المتعلم يحسب مخرجات أعضائه ويجمعها.
- وجود أعمال قابلة للتوازي لا يثبت سرعة معينة؛ الموارد والتنفيذ والتكلفة تحتاج قياسًا فعليًا.
ما الذي تنتظره مرحلة التعزيز؟
تصف GradientBoostingClassifier بناء نموذج إضافي على مراحل، وتدريب أشجار كل مرحلة على التدرج السالب للخسارة. [1]
تخيل سجل عمل بثلاث خانات: النموذج الحالي، والمادة التي ستتعلم منها المرحلة الجديدة، والنموذج بعد إضافتها. لا تملأ الخانة الثانية قبل معرفة الحالة الحالية للمجموعة. هذا اعتماد منطقي بين المراحل، وليس مجرد اختيار أن ننفذ الأعمال واحدًا بعد الآخر.
لا نساوي كل خسارة بفروق القيم الأصلية مباشرة. يعتمد وصف المادة التدريبية على الخسارة ونوع النموذج. المقارنة هنا عن الاعتماد بين المراحل، ولا تفترض أن المصنف يعامل الاحتمال بالطريقة نفسها التي يعامل بها نموذج انحدار قيمة عددية.
ما الذي تحتاجه شجرة الغابة؟
في بناء الغابة المدروس، تعتمد كل شجرة على متجه عشوائي مأخوذ استقلالًا من التوزيع نفسه. [2]
نفترض ثلاث مهام بناء مصطنعة: شجرةر 1 بعينتها وإعدادها، وشجرةر 2 بعينتها وإعدادها، وشجرةر 3 كذلك. لا تطلب ر 2 قائمة أخطاء ر 1 لتجعلها هدف تعلمها. تستطيع وصف مواد بناء الأشجار مسبقًا، ثم تنفيذها حسب الموارد المتاحة.
الاستقلال المقصود هنا يتعلق بآلية البناء عن تصحيح مخرج الشجرة السابقة. لا يعني أن تنبؤات الأشجار غير مترابطة إحصائيًا؛ قد تستعمل بيانات متشابهة وتخطئ في الحالات نفسها. فلا تجعل رسم المهام المنفصلة شهادة على تنوع كامل أو دقة مضمونة.
التنبؤ مرحلة مختلفة
بعد اكتمال التدريب، لا نعيد تعلم شجرة للحالة الجديدة. نطبق الأعضاء المتعلمين على خصائصها، ثم نجمع مخرجاتهم بحسب تعريف المجموعة. يمكن كتابة هذه الخطوات في سجل التنبؤ دون استدعاء تحديثات التدريب. هذا فصل بين دورين، لا وصف لبرنامج نفذناه.
وجود مجموع في التعزيز أو متوسط في غابة انحدار لا يكفي وحده لمعرفة كيف تدرب الأعضاء. اسأل عن مادة تعلم كل عضو وعلاقتها بالمراحل الأخرى. ثم راجع قاعدة الجمع ونوع المخرج، بدل استنتاج آلية التعلم من شكل المعادلة الأخيرة فقط.
ماذا نقيس في التشغيل؟
في مقارنة فعلية، سجل موارد الحاسوب وعدد الأعضاء وحجمهم والوقت والذاكرة. قد يتيح التنفيذ أعمالًا متوازية داخل بناء مرحلة تعتمد على سابقتها؛ لذلك لا يعني التتابع أن كل عملية داخلها متسلسلة على مستوى الجهاز. هذه ملاحظة تنظيمية وليست نتيجة سرعة.
ولا يعني إمكان بناء أشجار مستقلة أن تشغيلها معًا سيعطي زمنًا يساوي زمن شجرة واحدة. تقاسم الموارد والتكاليف الأخرى يؤثر في القياس. استخدم الاعتماد المنطقي لتفهم ما يمكن جدولته، ثم قس الأداء الفعلي، وقارن جودة التنبؤ بالتكلفة التي تحتاجها المهمة.
المصادر ومتابعة القراءة
- scikit-learn: GradientBoostingClassifier (يفتح في نافذة جديدة)scikit-learn.org
- Breiman: Random Forests (يفتح في نافذة جديدة)stat.berkeley.edu
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
