التباين بعد ضم مجموعتين لا يمكن استعادته من متوسطيهما وعدديهما وحدهما في كل حالة. المتوسط يصف مركز الأعداد، ولا يبين وحده انتشارها حوله. نؤلف ملفين لهما الملخص نفسه، ثم نحسب التباين لكل ملف لنعرف المعلومة التي أخفاها الملخص.
الخلاصة السريعة
لا؛ قد تتساوى المتوسطات والأعداد بين ملفين بينما يختلف تباين القيم بعد الضم، لأن الملخص لا يحفظ الانتشار داخل كل مجموعة.
- نستخدم تباينا بمقام عدد القيم: مجموع مربعات الفروق عن المتوسط مقسوما على العدد، وفق تعريف NumPy الافتراضي ddof=0. [1]
- في الملف الأول، كل مجموعة تحوي 2 و 8: العدد 2 والمتوسط 5. بعد الضم تصبح القيم 2 و 8 و 2 و 8 ؛ متوسطها 5 وتباينها 9.
- في الملف الثاني، كل مجموعة تحوي 5 و 5: العدد 2 والمتوسط 5 أيضا. بعد الضم تبقى أربع خمسات، فيكون التباين 0 رغم تطابق ملخص المتوسط والعدد.
- احفظ القيم أو ملخص انتشار كافيا مع تعريف المقام، إذا احتجت التباين لاحقا. هذه قوائم حسابية لا تثبت توزيع مجتمع أو دقة نموذج، ولم ننفذ NumPy.
أي تباين نريد حسابه؟
يحسب تعريف NumPy مع ddof=0 مجموع مربعات فروق القيم عن المتوسط مقسوما على عددها. [1]
نثبت المقام قبل المقارنة: سنقسم على 4 عند ضم أربع قيم. لا نخلط هذا الحساب بحساب يقسم على 3 ثم نفسر اختلاف الرقم على أنه أثر في البيانات. جميع أعداد تمريننا من الحقل والوحدة نفسيهما، ونستعملها لشرح الانتشار فقط.
نعرف عن كل مجموعة معلومتين في الملخص: عدد القيم ومتوسطها. السؤال ليس كيف نحسب المتوسط الكلي، بل هل تستطيع هاتان المعلومتان تحديد كل مربع فرق نحتاج إليه للتباين.
كيف يعطي الملف الأول تباينا 9 ؟
نؤلف الملف الأول بمجموعتين أ وب، وكل منهما 2 و 8. العدد في كل مجموعة 2 ، والمجموع 10 ، والمتوسط 5. عند الضم تصبح القائمة 2 و 8 و 2 و 8 ؛ مجموعها 20 وعددها 4 ، لذلك يبقى المتوسط 5.
الفروق عن 5 هي−3 ثم 3 ثم−3 ثم 3. مربع كل فرق 9 ، ومجموع المربعات 36 ؛ القسمة على 4 تعطي التباين 9. هذه الأرقام محسوبة من القيم المعلنة، ولا تصف تدريب نموذج أو بيانات مستخدمين.
لم نضف فرق متوسطين هنا؛ المتوسطان متساويان. مع ذلك توجد فروق داخل كل مجموعة عن مركزها، وهي التي أعطت الانتشار في هذا المثال.
كيف يحفظ ملف آخر الملخص ويغير التباين؟
نؤلف ملفا ثانيا: المجموعة أ فيه 5 و 5 ، والمجموعة ب فيه 5 و 5 أيضا. عدد كل مجموعة 2 ومتوسطها 5 ، مثل الملف الأول تماما. إذا حفظنا الملخصين فقط، فلا نستطيع معرفة أي ملف كان الأصل.
بعد ضم الملف الثاني نحصل على 5 و 5 و 5 و 5. المتوسط 5 ، لكن كل فرق عنه صفر، وكل مربع فرق صفر؛ التباين بمقام 4 يساوي 0. هكذا أعطى ملخص متطابق نتيجتين مختلفتين للتباين:9 و 0.
لو كان العدد والمتوسط كافيين وحدهما، لوجب أن تحدد المعلومات المتطابقة نتيجة واحدة. المثالان يبينان خلاف ذلك، دون الحاجة إلى افتراض شكل توزيع أو اختبار إحصائي.
| الملف المؤلف | المجموعة أ | المجموعة ب | ملخص كل مجموعة | التباين بعد الضم |
|---|---|---|---|---|
| الأول | 2 و 8 | 2 و 8 | عدد 2 ؛ متوسط 5 | 9 بمقام 4 |
| الثاني | 5 و 5 | 5 و 5 | عدد 2 ؛ متوسط 5 | 0 بمقام 4 |
ما الذي نحفظه إذا احتجنا الانتشار؟
نقترح الاحتفاظ بالقيم الأصلية عندما تسمح حاجة المهمة وسياسة البيانات، أو حفظ ملخص انتشار كاف مع العدد والمتوسط وتعريف المقام. لا نختلق انتشارا داخليا من متوسطين إذا لم يحفظه الملف.
كما لا نقول إن تساوي المتوسطات يجعل المجموعتين متشابهتين في كل خصائصهما. قد يجيب المتوسط عن سؤال المركز، بينما يتطلب سؤال الانتشار معلومات أخرى؛ نكتب حدود الملخص في التقرير الذي يسلمه مسار التحليل.
لم ننفذ NumPy أو نختبر توزيعا أو نموذجا. الحساب يثبت فقط أن هذا الملخص المحدد لا يعيد التباين في جميع الحالات، ولا يحكم أي الملفين أنسب لمهمة تعلم آلة.
المصادر ومتابعة القراءة
- NumPy: var (يفتح في نافذة جديدة)numpy.org
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
