تقنية

الخليط الغاوسي: لماذا لا تكفي المسافة لتحديد الانتماء؟

مخطط يجمع كثافتين متساويتين مع وزنين مختلفين قبل تطبيع الانتماء
تساوي المسافة لا يلغي اختلاف الأوزان.

يمثل الخليط الغاوسي البيانات بمكونات لها مراكز وتغايرات وأوزان. يحسب التنفيذ احتمالات انتماء العينة بتطبيع كثافات المكونات الموزونة. [1] [2]

الخلاصة السريعة

في الخليط الغاوسي، يتوقف الانتماء على الكثافة ووزن المكون معًا. قد تتساوى المسافة إلى مركزين، ومع ذلك يختلف احتمال الانتماء إليهما.

  • وزن المكون جزء من النموذج، أما انتماء عينة محددة فيتطلب تطبيع كثافتها الموزونة عبر المكونات. [2]
  • عند القيمة 1، ومركزي 0 و 2 وتباين واحد لكليهما وأوزان 0.8 و 0.2، تتساوى الكثافتان ويكون الانتماء 0.8 و 0.2.
  • إذا عكسنا الأوزان وحدها إلى 0.2 و 0.8، مع ثبات المركزين والتباين والقيمة، ينعكس الانتماء في هذا المثال المتناظر.
  • اختيار المكون صاحب الاحتمال الأكبر يعطي اسمًا واحدًا؛ يحتفظ الوصف الناعم بالاحتمالين، وهما مشروطان بالنموذج وليسا شهادة حقيقة.

ما الذي يدخل في الحساب؟

نفترض نموذجًا على خط عددي، بمكون أ مركزه صفر، ومكون ب مركزه اثنان. تباين كل منهما واحد. الوزن الأول 0.8 والثاني 0.2، ومجموعهما واحد. هذه معلمات وضعناها للتوضيح، ولم نستخرجها من تدريب.

يمكن كتابة قائمة منفصلة للمراكز وقائمة للأوزان. المركز يحدد موقع المكون، بينما يحدد الوزن مساهمته في الخليط قبل النظر إلى قيمة معينة. خلط القائمتين يجعل القارئ يتوقع أن أقرب مركز يفوز دائمًا.

في الكود المقروء تجمع كثافة كل مكون مع وزنه، ثم تطبع عبر مجموع المكونات للوصول إلى احتمالات الانتماء. [2]

قيمة تقع في المنتصف

نختبر القيمة 1. بعدها عن صفر يساوي بعدها عن اثنين؛ ومع التباين المتساوي تتساوى كثافتاها الغاوسيتان. إذا رمزنا إلى الكثافة المشتركة بقاف، فالمساهمتان هما 0.8×قاف و 0.2×قاف.

مجموع المساهمتين قاف. القسمة عليه تعطي 0.8 للمكون أ و 0.2 للمكون ب. لم نحتج إلى تقريب الكثافة لأن العامل المشترك اختصر؛ والتساوي هنا في الكثافات، لا في الأوزان.

لذلك لا يصلح جواب «النقطة في المنتصف، إذن النصف لكل مكون» لهذا النموذج. ذلك الجواب يستبدل أوزانه بأوزان متساوية دون تصريح. تثبيت المعلمات أولًا يكشف سبب اختلاف النتيجتين.

تغيير واحد يقلب النتيجة

نعكس الأوزان إلى 0.2 للمكون أ و 0.8 للمكون ب، ونحفظ القيمة 1 والمركزين والتباين. لا تتغير الكثافة المشتركة، لكن المساهمتين الموزونتين تتبادلان، فتنعكس احتمالات الانتماء.

هذه مقارنة بين نموذجين مفترضين، وليست خطوة تدريب أو دليلًا على أن البرنامج يغير الوزن تلقائيًا عند نقطة متوسطة. عندما تغير أكثر من معلمة، يلزم حساب الكثافات من جديد بدل نقل النتيجة.

ولو ابتعدت القيمة عن المنتصف، فلن تكون الكثافتان متساويتين بالضرورة. عندها لا يجوز نسخ الأوزان وإعلانها احتمالات انتماء؛ الاختصار المستخدم في مثالنا له شرط تناظر واضح.

اسم واحد أم وصف احتمالي؟

يتيح نموذج الخليط إسناد العينة إلى المكون الأكثر احتمالًا. [1] في النموذج الأول سيختار مثالنا أ، لكن ذلك لا يمحو مساهمة ب البالغة 0.2.

إذا عرضت سجلًا للمثال، اكتب المكون المختار والاحتمالين والمعلمات المفترضة. هكذا يستطيع قارئ السجل إعادة النتيجة، ويعرف أن تغيير وزن واحد قد يغير الاسم دون تحريك العينة.

لا تعني هذه النسب أننا تحققنا من مجموعتين طبيعيتين في الواقع. تسميتا أ وب للمكونات في حسابنا، لا لفئتين معروفتين مسبقًا. قبل تحويل المخرج إلى قرار، حدد ما الذي تمثله المكونات وما المعلومات المتاحة عن الحالة.

المصادر ومتابعة القراءة

  1. scikit-learn: Gaussian mixture models (يفتح في نافذة جديدة)scikit-learn.org
  2. scikit-learn source: mixture base (يفتح في نافذة جديدة)raw.githubusercontent.com

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.