تقنية

مصنف المركز الأقرب: متوسط الفئة ليس أقرب عينة

نقطتا كل فئة ومتوسطها تبينان اختلاف أقرب مركز عن أقرب عينة للحالة 0.2
لم نعرف التسمية الصحيحة للحالة؛ اختلاف القرار لا يثبت تفوقًا.

يمثل مصنف المركز الأقرب كل فئة بمركز. مع المسافة الإقليدية يكون المركز متوسط عينات الفئة؛ وهذا الملخص قد يقع حيث لا توجد عينة منها. [1]

الخلاصة السريعة

في مثالنا ذي المسافة الإقليدية والقبليات المتساوية ومن دون تقليص المراكز، تفوز الفئة أ بقرب متوسطها، بينما تفوز ب بقرب أقرب عينة منفردة. اختلاف القاعدتين لا يثبت أيهما أدق.

  • في النسخة الإقليدية يمثل المتوسط كل فئة؛ نثبت قبليات متساوية ولا نقلص المراكز في المثال. [1]
  • الفئة أ بالقيمتين −3 و 3 متوسطها صفر، والفئة ب بالقيمتين 1 و 2 متوسطها 1.5؛ لا يلزم أن يكون المتوسط عينة موجودة.
  • الحالة 0.2 أقرب إلى مركز أ بمسافة 0.2، لكن أقرب عينة منفردة إليها هي 1 من ب بمسافة 0.8، ضمن الإعدادات المثبتة.
  • المراكز تلخص فئات ذات تسميات معلومة؛ المثال لا ينشئ عناقيد، ولا يقيس تفوق مصنف على آخر في بيانات جديدة.

أي مركز وأي قاعدة قرار؟

توثق NearestCentroid المتوسط مع المسافة الإقليدية، والوسيط لكل خاصية مع مسافة Manhattan. لذلك لا نجعل كلمة مركز مرادفًا للمتوسط في كل إعداد. [1]

نقصر حسابنا على خاصية عددية واحدة، والمسافة الإقليدية، وقبليات متساوية، ومن دون تقليص المراكز. في فرع القبليات المتساوية يقارن التنفيذ المسافات إلى المراكز لاختيار الفئة. [2]

هذه الشروط تمنع قراءة المثال بوصفه حسابًا لكل إعدادات الواجهة. لا نحتاج هنا إلى احتمالات فئة محسوبة، ولا نضيف معلومات عن توزيع الخاصية سوى القيم التي نعلنها.

مركز في مكان لا توجد فيه عينة

لدينا فئتان مسمّاتان مسبقًا: أ تضم −3 و 3، وب تضم 1 و 2. مركز أ هو (−3+3)/2=0، ومركز ب هو (1+2)/2=1.5.

متوسط أ لا يساوي أيًا من عينتيها. إنه ملخص حسابي يقع بينهما، وليس بطاقة تدّعي أن عينة تدريب بقيمة صفر موجودة في الفئة. أما متوسط ب فيقع بين 1 و 2.

نتخيل سجلًا يعرض المركزين وحدهما. لن يخبرنا بأن أ تملك قيمتين متباعدتين في جهتين متقابلتين؛ ولا بأن ب قيمتاها متقاربتان نسبيًا. اختصار كل فئة إلى رقم واحد يحجب هذا التفصيل الذي ما زال ظاهرًا في قائمة العينات الأصلية.

الحالة نفسها تعطي قرارين مختلفين

نضع حالة جديدة مفترضة x=0.2. المسافة إلى مركز أ صفر هي 0.2، وإلى مركز ب 1.5 هي 1.3؛ لذا تختار قاعدة أقرب مركز أ في الإعدادات المثبتة.

نقارن الآن بقاعدة أقرب عينة منفردة، على القيم نفسها. المسافات إلى −3 و 3 و 1 و 2 هي 3.2 و 2.8 و 0.8 و 1.8؛ أقصرها 0.8 عند العينة 1 من ب، فتختار هذه القاعدة ب.

لا يوجد تعارض حسابي: المقارنة الأولى تستخدم نقطتين ملخصتين، والثانية أربع عينات. لم نثبت تسمية الحالة 0.2 الصحيحة، لذلك لا يجوز وصف أحد القرارين بأنه تصحيح للآخر أو دقة أعلى في هذا المثال.

هل المراكز تعني أننا نجمع عناقيد؟

نعرف أ وب قبل حساب المتوسطين. هذا حساب داخل فئات معطاة، لا عملية بحث عن مجموعتين مجهولتين. إذا استبدلنا أ وب بأسماء عناقيد مستنتجة لاحقًا، نكون قد بدلنا المهمة التي وصفناها.

وعند قراءة رسم، احتفظ بالعينات إلى جانب مراكزها إذا كان السؤال عن شكل الفئة. في مثالنا تكشف النقاط الأربع لماذا يمكن لمركز أ أن يفوز رغم وجود أقرب عينة من ب.

لا نجري اختبار أداء أو نقيس سرعة حفظ المركزين. نوضح فقط ما تقارنه قاعدة القرار وما تختصره. أي استعمال فعلي يحتاج فحص الإعدادات وبيانات المهمة ونتائجها، مع حفظ الفرق بين قرب ملخص الفئة وقرب عضو معين منها.

المصادر ومتابعة القراءة

  1. scikit-learn: NearestCentroid (يفتح في نافذة جديدة)scikit-learn.org
  2. scikit-learn: تنفيذ NearestCentroid (يفتح في نافذة جديدة)raw.githubusercontent.com

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.