تقنية

الجدول العريض والطويل في البيانات: هل زيادة الصفوف تعني قياسات جديدة؟

قياسات شريطين في يومين تمثل بصفين عريضين أو أربعة صفوف طويلة دون زيادة المعلومات
رسم أصلي للقياسات الافتراضية نفسها بصيغتين؛ لا توجد تجربة ميدانية.

الجدول العريض والطويل في البيانات قد ينظمان المعلومات نفسها بطريقتين. تصف pandas وظيفة melt بأنها نقل أعمدة القياسات إلى صفوف، مع الاحتفاظ بأعمدة التعريف المختارة. هذا تغيير بنية، ولا يعني بحد ذاته جمع قياسات جديدة. [1]

الخلاصة السريعة

حدد معرف الشيء ومتغير القياس والوقت والوحدة، ثم اختر البنية المناسبة. قارن القيم نفسها قبل التحويل وبعده، ولا تجعل زيادة الصفوف دليلا على زيادة الحالات المستقلة.

  • في التحويل إلى طويل، تبقى أعمدة المعرف، ويصبح اسم عمود القياس وقيمته حقولا في صفوف. [1]
  • شريطان مقاسان في يومين يعطيان أربعة قياسات في المثال، سواء كتبت في صفين عريضين أو أربعة صفوف طويلة.
  • العودة إلى عريض تحتاج تحديد خلية كل قياس؛ pivot في pandas لا يجمع قيما متعددة لزوج فهرس وعمود واحد. [2]
  • راجع تطابق المعرف والوقت والوحدة والقيمة وحالة الغياب، وحدد قرار التكرار قبل أي تجميع.

ماذا يغير التحويل في شكل الجدول؟

تستخدم melt أعمدة id_vars للتعريف وvalue_vars لاختيار القياسات المراد نقلها. [1]

في مثال افتراضي، نسمي عمود المعرف «الشريط»، وعمودي القياس «اليوم أ» و«اليوم ب». الشكل العريض يضع قياسي كل شريط في صف واحد. الشكل الطويل الذي نقترحه يضع الشريط واليوم والطول في كل صف. نكتب في وصف البيانات أن القياس طول بالسنتيمتر، بدلا من توقع أن تنقل الأداة الوحدة أو معنى اليوم من تلقاء نفسها.

كيف نمثل المعلومات نفسها دون قياسات إضافية؟

نفترض شريطين ورقيين للتعليم فقط: طول الأحمر 8 ثم 9 سنتيمترات في اليومين، وطول الأزرق 11 ثم 12. هذه أرقام من إنشاء الكاتب، ولم نقس شرائط فعلية. الجدول التالي هو الصيغة الطويلة المقترحة للقياسات الأربع.

في الشكل العريض سيكون لدينا صف للأحمر يحمل 8 و9، وصف للأزرق يحمل 11 و12. انتقالنا من صفين إلى أربعة لا يضيف شريطين، ولا يعيد القياس في الميدان. لذلك نكتب عدد الشرائط وعدد القياسات كلا على حدة، ونراعي وحدة المهمة عند تجهيز أمثلة النموذج.

الشريطاليومالطول بالسنتيمتر
أحمرأ8
أحمرب9
أزرقأ11
أزرقب12

ماذا إذا وجد قياسان للخلية نفسها؟

توضح وثائق pivot أنه لا يدعم تجميع البيانات، ويرفع خطأ عندما يقابل زوج فهرس وعمود قيما متعددة. [2]

لو أضفنا للأحمر في اليوم أ قيمة ثانية هي 10، فلن يحسم عنوان «اليوم أ» هل هذه إعادة قياس أم تصحيح للقيمة 8 أم قراءة في وقت آخر. أخذ المتوسط 9 قد يكون قرارا معلنا لمهمة معينة، لكنه لا يستعيد إحدى القراءتين الأصليتين ولا يفسر سبب التعدد. نحتاج وقتا أدق أو علامة تصحيح أو سياسة تجميع مناسبة للمعنى.

كيف نثبت أن التنظيم حفظ المعنى؟

نقترح مراجعة الأزواج الأربعة من المعرف واليوم وقيمها، ثم التحقق من الوحدة والقراءات الغائبة. وإذا أعدنا الشكل العريض، نقارن كل خلية بقياسها المعروف بدلا من الاكتفاء بتساوي مجموع الأرقام؛ فقد يبقى المجموع ثابتا مع تبديل قياسين بين شريطين.

هذه خطة مراجعة مستقلة، ولم نشغل أداة تحويل أو ندع أن أحد الشكلين أنسب دائما. نختار الشكل بحسب السؤال والبرنامج، ونوثق وحدة الصف بعد الاختيار. إذا أضفنا مرحلة تجميع، نسميها صراحة ونحفظ سببها؛ فلا نعامل تغيير البنية وتجميع قياسات مختلفة كخطوة واحدة بلا تفسير.

المصادر ومتابعة القراءة

  1. pandas: melt (يفتح في نافذة جديدة)pandas.pydata.org
  2. pandas: DataFrame.pivot (يفتح في نافذة جديدة)pandas.pydata.org

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.