تقنية

ParameterSampler: هل عدد السحوبات هو عدد إعدادات مختلفة؟

رسم يفصل عقد المعاينة دون إرجاع عن عقد مع الإرجاع وسجل بثلاث سحوبات له هويتان
رسم تحريري لحساب معلن؛ لم ننفذ بحثًا أو تدريب نموذج.

عند قراءة ParameterSampler والإرجاع، لا تعامل ثلاث سحوبات تلقائيًا على أنها ثلاثة مرشحين مختلفين. يربط التوثيق طريقة المعاينة بنوع القيم التي قدمتها. نعلن مجموعتين صغيرتين ونعد الهويات في سجلهما يدويًا، دون توليد عشوائي أو تشغيل بحث عن نموذج.

الخلاصة السريعة

إذا كانت كل القيم قوائم فالمعاينة دون إرجاع؛ وجود توزيع واحد على الأقل يجعلها مع الإرجاع، وقد تتكرر تركيبة. [1]

  • يوثق ParameterSampler الفرق بين كل القيم قوائم ووجود توزيع واحد على الأقل؛ الأخير يستخدم الإرجاع. [1]
  • قائمتا العمق والنوع في مثالنا تصفان أربع تركيبات؛ سجل معلن من ثلاث سحوبات دون إرجاع يحتوي ثلاث هويات مختلفة.
  • مع توزيع متقطع مفترض، سجلنا الآخر ثلاث سحوبات منها تركيبة مكررة؛ عدد السحوبات ثلاثة وعدد الهويات اثنان، وهذا مثال ممكن لا ناتج عشوائي جربناه.
  • اقرأ نوع المدخل والإعداد الكامل وقاعدة التقييم؛ عدد السحوبات أو الهويات لا يثبت تغطية البحث أو أفضلية نموذج، ولم نشغل ParameterSampler.

ما الذي يغير طريقة المعاينة؟

عندما تكون كل المعاملات قوائم تستخدم ParameterSampler المعاينة دون إرجاع، ومع توزيع واحد على الأقل تستخدم الإرجاع. التوزيع المقبول هنا يقدم دالة rvs، والقوائم تختار قيمها بالتساوي. [1]

هذا وصف لعقد المدخل، وليس حكمًا على كلمة «عشوائي» وحدها. قائمة مكتوبة من رقمين تختلف عن كائن توزيع يمكن أن يسحب الرقمين. قد تتشابه القيم الممكنة ظاهريًا، لكن تغيير نوع المصدر يغير طريقة إعادة زيارة الإعداد.

وللمراجعة نسجل لكل حقل هل أعطيناه قائمة أم توزيعًا، ثم نسجل التركيبة كاملة في كل سحبة. وجود الرقم نفسه في عمقين لا يثبت تكرار المرشح إن اختلف نوعه؛ وحدة العد هي الإعداد الكامل الذي قررنا مراجعته.

كيف نعد حالة كل القيم قوائم؟

نعلن عمقين: واحد واثنان، ونوعين: أ وب. فضاء التركيبات أربع هويات: واحد أ، واحد ب، اثنان أ، اثنان ب. نختار للورقة سجلًا من ثلاث هويات: اثنان ب، واحد أ، واحد ب. كل هوية تظهر مرة واحدة في هذا السجل.

العدد ثلاثة هنا أقل من عدد التركيبات الأربعة. لذلك لا يثبت السجل فحص الفضاء كله؛ تركيبة اثنين أ لم تظهر. ولا نمنح أول سحبة درجة أفضل بسبب موقعها، إذ لم نكتب نتائج تقييم أصلًا.

هذه القائمة ترتيب مؤلف للتوضيح، لا ترتيب التقطناه من مكتبة أو بذرة عشوائية. قيدنا الطلب بثلاث سحوبات داخل فضاء أربع حالات، فلا نستنتج منه سلوك طلب أكبر من الفضاء أو رسالة تحذير لم نقرأ عقدها.

متى تختلف السحوبات عن الهويات؟

نستبدل قائمة العمق بتوزيع متقطع مفترض يدعم الواحد والاثنين، ونترك قائمة النوع. نكتب سجلًا ممكنًا مع الإرجاع: واحد أ، واحد أ، اثنان ب. السجل له ثلاثة مواضع، لكنه يحتوي هويتين فقط.

تكررت التركيبة كاملة في الموضعين الأول والثاني، لا مجرد رقم العمق. ولا نزعم أن أي توزيع مستمر سيكرر قيمة بعينها بهذا الشكل؛ اخترنا توزيعًا متقطعًا كي يكون المثال واضحًا، ولم ننسب احتمالات محددة لنتيجته.

إذا كانت لكل زيارة قياسات مختلفة، نحتفظ بموضع الزيارة وهوية التركيبة معًا. حذف المكرر قد يحذف تجربة قياس مقصودة، بينما تسميته إعدادًا جديدًا تضخم نطاق البحث. قاعدة التجميع تحتاج أن تعرف أي سؤال تريد الإجابة عنه.

ماذا لا يخبرك عدد السحوبات؟

زيادة العدد تعني طلب سجل أطول ضمن العقد الذي حددته، ولا تقدم هنا شهادة بأن كل إعداد مفيد جرت زيارته أو أن أفضل إعداد وجد. لم نعرف درجات المرشحين أو ميزانية القياس أو حتى نموذجًا حقيقيًا يستعمل الاسمين أ وب.

كذلك لا يصبح عدد مرات التدريب مساويًا لعدد الهويات تلقائيًا. التقييم المتكرر، والإخفاق، وإعادة التدريب النهائية تفاصيل خارج هذا السجل. نراجعها حين نقرأ إعداد البحث الكامل بدل استخراجها من رقم السحوبات وحده.

قبل تفسير تقرير، ضع بجانب العدد ثلاثة حقول: أنواع مصادر المعاملات، وعدد المواضع المسجلة، وعدد التركيبات الفريدة. عندها تستطيع بيان ما تكرر وما غاب بدقة، مع بقاء الجودة والكلفة أسئلة تحتاج قياسات فعلية.

المصادر ومتابعة القراءة

  1. scikit-learn: ParameterSampler (يفتح في نافذة جديدة)scikit-learn.org

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.