تقنية

التحليل التمييزي الخطي: لماذا تغير التباينات معنى القرب؟

مقارنة مسافات مربعة عادية ومعدلة لنقطة واحدة ثم تغير القرار بتغير الاحتمالات القبلية
القرب المعدل لا يكفي وحده لتفسير القرار حين تختلف القبليات.

التحليل التمييزي الخطي LDA مصنف يفترض كثافة غاوسية لكل فئة، مع مصفوفة تغاير مشتركة بينها. له أيضًا استخدام لإسقاط الأبعاد. [1]

الخلاصة السريعة

يوازن قرار LDA بين المسافة المعدلة بالتغاير واحتمال الفئة القبلي؛ لذلك لا يساوي دائمًا اختيار أقرب متوسط بالمسافة العادية. [2]

  • مصفوفة التغاير مشتركة في النموذج؛ لا يعني ذلك تطابق متوسطات الفئات. [1]
  • في المثال ذي التغاير القطري والقبليات المتساوية، نختار ب رغم أن المسافة العادية إلى أ أصغر.
  • مع القيم نفسها، تغير قبليات 0.9 لأ و 0.1 لب القرار إلى أ؛ المقارنة السابقة اشترطت تساويهما.
  • حد القرار الخطي يتعلق بالتصنيف؛ عدد مكونات الإسقاط يخص transform، وليس عدد الفئات المتوقعة. [1]

ما الذي تشترك فيه الفئات؟

يفترض LDA مصفوفة تغاير واحدة، وتستعمل الدرجة مسافة مربعة معدلة بعكس هذه المصفوفة، مع لوغاريتم الاحتمال القبلي. [2]

لشرح الحساب نختار خاصيتين عدديتين س وص، ومتوسط أ=(0، 0) ومتوسط ب=(2، 6). التباين المشترك لس هو 1، ولص هو 9، والتغاير بينهما صفر. هذا اختيار قطري لتبسيط المثال، وليس شرطًا بأن كل LDA يتجاهل العلاقات بين الخصائص.

نفترض أن هذه القيم معلومة؛ لا نستخرجها من عينة مجهولة. اختلاف المتوسطين يحدد موضع الفئتين، بينما يحدد التباين المشترك كيف تُوزن الفروق عن هذين الموضعين.

مثال: أقرب بالمسافة العادية وأبعد بالمعدلة

نقرأ النقطة (2.2، 0). مربع مسافتها العادية إلى أ يساوي 4.84، وإلى ب يساوي 0.04+36=36.04. بهذه القراءة تبدو أ أقرب كثيرًا.

لكن المسافة المعدلة في مثالنا تقسم مربع فرق س على 1 ومربع فرق ص على 9. تصبح مسافة أ 4.84، ومسافة ب 0.04+36/9=4.04. مع قبليات متساوية، تعطي الدرجة الأكبر لب؛ فهي الأقل مسافة معدلة.

الفرق الكبير في ص أصبح أقل تأثيرًا لأن تباين ص المشترك أكبر. لا ننتقل من هذا المثال إلى قاعدة «تجاهل الخاصية المتغيرة»؛ ما زال فرق ص يدخل الحساب، ونحتاج المصفوفة كاملة عندما يوجد تغاير.

لماذا قد تقلب القبليات الجواب؟

نثبت المتوسطين والمصفوفة والنقطة، ونغير فقط احتمال أ القبلي إلى 0.9 واحتمال ب إلى 0.1. فرق درجة ب ناقص أ يصبح −0.5×(4.04−4.84)+ln(0.1/0.9)، أي 0.4−ln(9)≈−1.797.

أصبحت درجة أ أعلى، فاختيرت أ. الرقم السالب هنا فرق درجتين، وليس احتمالًا سالبًا. المقارنة توضح ضرورة كتابة القبليات بجانب نتيجة القرب؛ إخفاؤها يجعل القرارين المختلفين يبدوان متناقضين.

إذا كان التقرير يعرض فئة واحدة فقط، أضف القيم المفترضة أو مصدر تقديرها. لا نستنتج أن نسبة 0.9 ملائمة لمجتمع حقيقي، ولا أن هذا الاختيار أفضل دقة من تساوي القبليات.

أين يظهر الخط وأين يظهر الإسقاط؟

يعرض التوثيق حدود قرار خطية لهذه الفرضية المشتركة. وتحدد n_components عدد المكونات في transform، لا عدد الفئات. [2] [1]

في مثال القبليات المتساوية، تتساوى الدرجتان على الخط س+ص/3=2. النقطة المختارة تقع في جهة ب. تغيير القبليات ينقل موضع المساواة؛ لا يحول حد هذا النموذج إلى دائرة.

عند قراءة نتيجة LDA، حدد هل الناتج اسم فئة أم إحداثيات بعد الإسقاط. المثال الحالي يحسب اختيار فئة فقط. وضوح الحساب لا يثبت أن الفرضيات مناسبة للبيانات؛ يلزم تقييم المهمة الفعلية قبل تبني القرار.

المصادر ومتابعة القراءة

  1. scikit-learn: LinearDiscriminantAnalysis (يفتح في نافذة جديدة)scikit-learn.org
  2. scikit-learn: LDA and QDA (يفتح في نافذة جديدة)scikit-learn.org

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.