تقنية

Hyperband: هل تبدأ الجولات بعدد المرشحين والموارد نفسه؟

رسم لثلاث بدايات Hyperband مصغرة يبين مجموع الموارد المحسوب واختلافه مع التقريب
رسم تحريري لحساب معلن؛ لم ننفذ بحثًا أو تدريب نموذج.

جولات Hyperband وميزانيتها لا تختزل إلى جدول تنصيف واحد. تعرض الخوارزمية أكثر من بداية: مرشحون كثيرون بموارد قليلة، أو عدد أصغر بموارد أكثر. نحسب ثلاث جولات من معادلات الورقة لميزانية مصغرة، ونفصل مواضع المرشحين عن هوياتهم وكلفة الجهاز الفعلية.

الخلاصة السريعة

تختلف بداية الجولات في العدد والمورد الفردي؛ الميزانية الاسمية لا تضمن تساوي حاصل الموارد بعد التقريب في كل جولة.

  • تحدد Algorithm1 عدد جولات من حد المورد R وعامل eta، وتعين لكل جولة عدد بداية ومورد بداية مختلفين. [1]
  • مع R = 9 وeta = 3 ، بداياتنا المحسوبة تسعة بواحد، وخمسة بثلاثة، وثلاثة بتسعة؛ كل مورد هنا حساب معلن لا زمن تشغيل.
  • التقريب في الجولة الوسطى يترك 5 ثم 1 مرشحًا بموارد 3 ثم 9 ؛ مجموع المنتجات 24 ، مقابل 27 للبدايتين الأخريين في مثالنا.
  • عد البدء يعطي 17 موضعًا، لا 17 هوية مضمونة الاختلاف؛ لم ننفذ الخوارزمية أو نقس الأداء أو كلفة إعادة استعمال موارد التدريب.

لماذا لا تكفي بداية واحدة؟

تحدد Algorithm1 في ورقة Hyperband جولات s من s_max إلى صفر، حيث s_max أرضية لوغاريتم R بالأساس eta، وB يساوي(s_max+1)R. [1]

نختار R = 9 وeta = 3 للشرح، فتكون s_max اثنين وB سبعة وعشرين. الأعداد تصف المورد الأعلى والعامل في الحساب، لا جهازًا أو نموذجًا اختبرناه. لدينا ثلاث قيم للجولة: اثنان وواحد وصفر.

الفكرة التي نراجعها هي توزيع عدد البداية ومورد الفرد بين هذه الجولات. لا نجعل إعداد المورد الصغير ناتج نجاح، ولا نحول كلمة «جولة» إلى تشغيل كامل انتهى في بيئة فعلية. الورقة تعطينا قاعدة حساب نطبقها يدويًا.

كيف نحسب البدايات الثلاث؟

تستخدم المعادلة عدد البداية بتقريب حاصل(B/R)×eta^s÷(s+1) إلى أعلى، ومورد البداية R×eta^(-s). [1]

عند s اثنين، عدد البداية تقريب 3×9÷3 ، أي تسعة، والمورد واحد. عند s واحد، العدد تقريب 3×3÷2 إلى أعلى، أي خمسة، والمورد ثلاثة. عند s صفر، العدد ثلاثة والمورد تسعة. إذن تقل البداية العددية من تسعة إلى خمسة إلى ثلاثة.

لكن البدء بخمسة هنا مهم: الحساب قبل التقريب 4.5 ، لا خمسة تمامًا. حذف خطوة التقريب يغير قائمة المرشحين المفترضة. نسجل ثلاث بطاقات منفصلة كي لا نعطي كل جولة تسعة مرشحين أو نساوي موارد بدايتها بالحد الأعلى.

لماذا تكون الجولة الوسطى 24 بدل 27 ؟

يوثق الجدول الداخلي عددًا n_i بأرضية n×eta^(-i)، وموردًا r_i = r×eta^i. [1]

الجولة الأولى مراحلها: تسعة بواحد، وثلاثة بثلاثة، وواحد بتسعة. جمع المنتجات 9+9+9=27. الجولة الوسطى تبدأ خمسة بثلاثة، ثم يبقى أرضية خمسة÷ثلاثة، أي واحد، مع تسعة؛ المجموع 15+9=24. الأخيرة ثلاثة بتسعة، ومجموعها 27.

إذن الميزانية B = 27 في المعادلة لا تصبح قولًا إن كل جدول مصغر يستعمل 27 تمامًا. لا نملأ الفرق بثلاثة موارد إضافية من عندنا. والمنتجات هي حساب موارد كل تقييم في الورقة، لا قياس عمل إضافي أو كلفة فعلية للاستكمال من حالة سابقة.

هل 17 موضع بدء يعني 17 إعدادًا فريدًا؟

جمع 9+5+3 يعطي 17 موضع مرشح عند البداية عبر الجولات. لم نقدم قيم المعاملات التي تولد في كل موضع، لذلك لا نثبت 17 هوية مختلفة أو عدم تكرار إعداد بين جولتين. لا يكشف عدد المواضع محتوى المرشح.

كذلك لم نقدم درجات تتيح تحديد من بقي، أو تجربة تسمح بمقارنة Hyperband بطريقة أخرى. ميزانية الورقة ليست دقائق تشغيل، ولا إثباتًا بأن النموذج الأعلى موردًا أفضل بالضرورة. اختيارات الموارد تحتاج معنى واضحًا في المهمة الفعلية.

قبل عمل حقيقي، احتفظ بمعادلات الجولة والتقريب وهويات المرشحين والموارد والنتائج التي قستها. يمكن بعدها دراسة ما حدث بالفعل. مثالنا يثبت الحسابات المذكورة فقط، ويترك الوقت والنجاح وطريقة الاستكمال دون قيم مخترعة.

المصادر ومتابعة القراءة

  1. Hyperband: Algorithm1 (يفتح في نافذة جديدة)jmlr.org

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.