بايز الساذج الغاوسي يستخدم متوسطًا وتباينًا لكل خاصية داخل كل فئة. تتيح هذه المعلمات حساب كثافات غاوسية عند المدخل. [1] [2]
الخلاصة السريعة
الكثافة عند قيمة عددية ليست احتمال تلك القيمة؛ في مثالنا يمكن أن تتجاوز واحدًا دون أن تصبح نسبة نجاح أعلى من 100%.
- يحتفظ GaussianNB بمتوسطات وتباينات الخصائص لكل فئة، ويمكن تحديد القبليات. [1]
- دالة الكثافة تستخدم الانحراف المعياري، وهو جذر التباين؛ قيمة الكثافة قد تتجاوز واحدًا. [2]
- في المثال ذي القبليات المتساوية، تختلف الكثافتان رغم تساوي البعد عن المتوسطين، بسبب اختلاف الانتشار.
- الاستقلال المفترض بين الخصائص مشروط بالفئة؛ لا يعني استقلالها في البيانات كلها أو صحة الفرضية تلقائيًا. [3]
ما الأرقام التي تصف كل خاصية؟
يسجل التوثيق المتوسط والتباين لكل خاصية وفئة، ويضيف var_smoothing مقدارًا لاستقرار التباين حسابيًا. [1]
نستعمل خاصية واحدة لتفكيك الحساب. نفترض متوسط أ=1 وانحرافها المعياري 0.1، ومتوسط ب=1.4 وانحرافها المعياري 0.2. إذن التباينان 0.01 و 0.04. هذه قيم مفترضة قبل أي إضافة للاستقرار، وليست ناتج تشغيل GaussianNB.
اكتب هل الرقم المعروض تباين أم انحراف معياري. استعمال 0.01 بدل 0.1 في موضع الانحراف داخل الصيغة يغير التوزيع، ولا يمثل مجرد اختلاف في تسمية العمود.
لماذا تكون الكثافة أكبر من واحد؟
للمتوسط μ والانحراف σ، الكثافة هي exp(−(x−μ)²/(2σ²))/(σ√(2π)). يوضح توثيق SciPy التحجيم بالإزاحة والقسمة على مقياس التوزيع. [2]
عند متوسط أ نفسه x=1، تصبح الكثافة 1/(0.1√(2π))≈3.989. هذا ارتفاع دالة عند موضع عددي، وليس احتمالًا قدره 398.9%. تغيير وحدة قياس الخاصية يغير ارتفاع الكثافة أيضًا.
إذا وجدت 3.989 في خطوة حسابية فلا تقصه إلى واحد بحجة أن الاحتمال لا يتجاوزه. السؤال الأول: هل يعرض الجدول كثافة، أم درجة مجمعة، أم احتمال فئة بعد التطبيع؟ الخلط بين هذه الأسماء يغير معنى النتيجة.
مثال: البعد نفسه والكثافة مختلفة
نقرأ القيمة x=1.2. تبعد 0.2 عن كل من المتوسطين، لكن بعدها المعياري عن أ يساوي 2، وعن ب يساوي −1. بتطبيق الصيغة، كثافة أ نحو 0.540، وكثافة ب نحو 1.210.
نفترض قبليات متساوية فنقارن الناتجين بعد ضرب كليهما في القبلي نفسه. ترجح ب. الانتشار الأكبر لب جعل هذه القيمة أقل بعدًا بوحدة انحرافها، مع بقاء العامل 1/σ جزءًا من الحساب.
لم نحول 1.210 إلى احتمال فئة جاهز. ولو تغيرت القبليات لوجب إعادة المقارنة. الأرقام هنا مثال لخاصية واحدة، وليست حكمًا على دقة نموذج متعدد الخصائص أو على معايرة احتمالاته.
أين يدخل افتراض الاستقلال؟
يقابل GaussianNB نموذجًا غاوسيًا بمصفوفة قطرية داخل كل فئة؛ يكون الاستقلال مشروطًا بالفئة. [3]
تخيل تسجيل لونين عدديين في بطاقة حرفية. قد ترتبط قيمتاهما عند جمع جميع أنواع البطاقات، حتى لو افترض نموذجنا استقلالهما بعد تحديد النوع. لذلك عبارة «ساذج» لا تعني أننا قسنا غياب كل علاقة في الملف.
عند مراجعة تقرير، تحقق من معاني المعلمات والقبليات ومن ملاءمة النموذج للبيانات. وجود قيم عددية لا يثبت شكلًا غاوسيًا. يشرح المثال الفرق بين الكثافة والاحتمال والانتشار؛ لا يضمن أن الافتراضات ستصف قياسات حقيقية.
المصادر ومتابعة القراءة
- scikit-learn: GaussianNB (يفتح في نافذة جديدة)scikit-learn.org
- SciPy: scipy.stats.norm (يفتح في نافذة جديدة)docs.scipy.org
- scikit-learn: LDA and QDA (يفتح في نافذة جديدة)scikit-learn.org
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
