ربط تقييم النموذج بنسخة البيانات يجعل الرقم قابلًا للفهم: أي نموذج، وعلى أي مجموعة، وبأي معيار؟ تغيير النموذج والبيانات معًا لا يعزل أثر أي منهما في المقارنة.
الخلاصة السريعة
اكتب زوج النموذج والبيانات لكل نتيجة، ثم ثبت شروط المقارنة؛ لا تنسب فرق رقمين إلى النسخة الجديدة إذا تغيرت مجموعة التقييم أيضًا.
- في MLflow 3.4.0 يمكن ربط log_metrics بمعرف النموذج ومجموعة البيانات، إلى جانب هوية التشغيل؛ هذه روابط تسجيل وليست ضمانًا تلقائيًا لصحة التقييم. [1]
- بطاقتا م 1/د 1 بنتيجتين صحيحتين من أربع وم 2/د 2 بأربع من أربع تغيران الطرفين؛ الفرق وحده لا يثبت أثر النموذج فقط.
- نضيف م 2/د 1 بثلاث صحيحة من أربع مع ثبات السجلات والمرجع ومعيار التصحيح؛ تحسن سجل واحد يخص هذه المقارنة المحددة.
- احفظ قائمة السجلات والمرجع وإعدادات التقييم وهوية المخرج؛ تطابق أسماء النسخ أو كتابة سجل لا يكفيان لإعادة إنتاج النتيجة.
سجل الزوج الذي ينتمي إليه الرقم
في مصدر MLflow 3.4.0 المقروء، تقبل log_metrics هوية تشغيل ومعرف نموذج ومجموعة بيانات مرتبطة بالمقاييس، ويحفظ التنفيذ اسم المجموعة وبصمتها ضمن الربط. [1]
نستفيد من فكرة الربط دون أن نفترض أن كل ملف يحوي هذه المعلومات تلقائيًا. بطاقة تقييم مفهومة تقول مثلًا: هذه قيمة المعيار تحت النموذج م 1 على المجموعة د 1. الاسم وحده لا يبين السجلات أو المرجع أو إعدادات الحكم، ولذلك نصل البطاقة بوصف تلك العناصر.
لا يقدم المقال استدعاء تسجيل نفذناه، ولا يلزم كل أداة بواجهة MLflow. المطلوب أن يكون الرقم منسوبًا إلى ما أنتجه؛ الحقول الموثقة مثال على دعم هذا الربط في نسخة محددة.
ما الذي تغير بين البطاقتين؟
نؤلف تمرين تصنيف بأربع بطاقات في كل مجموعة، وبحكم صحة واحد لكل بطاقة. نقول إن م 1 على د 1 وافق المرجع في حالتين من أربع، بينما م 2 على د 2 وافقه في أربع من أربع. هاتان نتيجتان افتراضيتان كتبناهما، لا قياسات نموذجين.
لو احتفظ التقرير باسم النموذج والعدد فقط، فقد يبدو أن النسخة الجديدة رفعت الأداء من النصف إلى الكمال. لكننا غيرنا مجموعة التقييم أيضًا. ربما كانت د 2 أسهل أو مختلفة؛ لم نثبت السبب، ولا نستطيع طرح أثر البيانات من فرق العدد بلا دليل آخر.
لا يعني هذا أن المقارنة بلا فائدة مطلقًا. إنها تصف سجلين مختلفين، ويجب أن تحملهما بتلك الصفة. السؤال الذي لم تجب عنه هو: ماذا يحدث للنتيجة على السجلات نفسها عند تغيير النموذج وحده؟
أضف مقارنة لها قاعدة مشتركة
نضيف بطاقة ثالثة: م 2 على د 1 وافق المرجع في ثلاث من أربع. نثبت أن د 1 هنا تحتوي السجلات نفسها، بالإجابات المرجعية نفسها ومعيار الصحة نفسه الذي استعملناه مع م 1.
على هذا الأساس يرتفع العدد من حالتين إلى ثلاث؛ أي حالة صحيحة إضافية من أربع. النسبتان هما 50% و 75% تحت القاعدة المعلنة. هذه معلومة أضيق من بطاقة الأربع الصحيحة على د 2، وأكثر مباشرة للسؤال عن تبديل النموذج على د 1.
لا تثبت أربع حالات نجاحًا على كل بيانات العالم، ولا نعلن دلالة إحصائية من هذا التمرين. وإذا تغيرت طريقة تصحيح جواب ما، لم تعد عبارة «المجموعة نفسها» وحدها كافية لضمان ثبات أساس المقارنة.
ما الذي يحتاجه من يراجع النتيجة؟
نرفق لكل بطاقة قائمة السجلات وإجاباتها المرجعية وتعريف الصحة وإعدادات التقييم وهوية مخرج النموذج الذي قورن بها. نفصل ما هو معروف عما تركناه مجهولًا، بدل اعتبار اسم د 1 رابطًا يشرح كل تفاصيلها.
إذا رأى المراجع م 2/د 1 ثلاثًا من أربع، يستطيع أن يسأل عن الحالة التي تغير حكمها، ثم عن سبب ذلك. تسجيل النتيجة لا يجيب عن السبب تلقائيًا. كذلك لا تضمن أسماء النسخ وحدها إعادة التشغيل بالبيئة نفسها أو استرجاع مدخل لم يحفظ.
الرسم يضع بطاقات المقارنة جنبًا إلى جنب ويبرز الزوج المشترك في البيانات. لم ندرب نموذجًا أو ننفذ تقييمًا أو نسجل تشغيلًا في MLflow؛ أعددنا تمرينًا يمنع نسبة فرق رقمين إلى متغير لم نعزله.
المصادر ومتابعة القراءة
- MLflow 3.4.0: tracking/fluent.py — log_metrics (يفتح في نافذة جديدة)raw.githubusercontent.com
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
