تقنية

نسبة اتفاق الموسمين: كيف نحسب تطابق الأحكام على الحالات نفسها؟

ست صور مشتركة تتفرع إلى أربعة أزواج أحكام متطابقة وزوجين مختلفين، وتنتج نسبة اتفاق نحو ستة وستين فاصل سبعة بالمئة
رسم أصلي لحساب على جدول افتراضي؛ لا جلسة وسم أو قياس نموذج.

نسبة اتفاق الموسمين تصف مقدار تطابق أحكامهما على بيانات مشتركة. في مهمة تعطي كل صورة فئة واحدة، يمكن عد الحالات التي اختار فيها الاثنان الفئة نفسها، ثم قسمتها على عدد الحالات المقارنة. [1] نطبق ذلك على ست صور افتراضية، مع توضيح ما نعده وما لا تثبته النسبة.

الخلاصة السريعة

اربط حكمي الموسمين بالحالة نفسها، وعد أزواج الأحكام المتطابقة، ثم اقسمها على عدد الحالات المقارنة؛ الناتج اتفاق مرصود، لا نسبة صحة الوسوم.

  • حسابنا يخص موسمين وفئة واحدة لكل حالة مشتركة، مع أحكام مستقلة؛ لا نحول تلقائيا ثلاث أحكام أو عدة فئات للصورة إلى الصيغة نفسها.
  • في المثال توجد أربع حالات متطابقة من ست؛ الاتفاق المرصود يساوي نحو 66.7 ٪، والاختلاف حالتان.
  • تحقق من معرف الصورة وإصدارها ودليل الفئات قبل المقارنة؛ ترتيب الصف وحده لا يكفي لربط الحكمين.
  • الاتفاق الجيد لا يضمن صحة التصنيف. [1] النسبة تخص الحالات المعروضة وطريقة الحكم؛ لا تثبت اتفاق البيانات كلها أو جودة نموذج.

ما وحدة المقارنة التي نختارها؟

نفترض ست صور تعليمية لأشكال مرسومة، وفئتين هما «دائرة» و«مستطيل». يختار كل موسم فئة واحدة لكل صورة وفقا للدليل نفسه، دون الاطلاع على اختيار الآخر قبل تسجيل حكمه. هذه شروط مثالنا، ولم ننفذ جلسة وسم.

وحدة العد صورة واحدة لها زوج من الأحكام، وليست عدد كلمات الفئات أو عدد الموسمين. اتفاق الموسمين في صورة يعطي حالة متطابقة واحدة؛ لا نحسب اختيار كل منهما توافقا منفصلا ثم نضاعف العدد.

إذا كان السؤال عن ثلاثة موسمين أو عن مجموعة فئات لكل صورة، نحتاج تعريف مقارنة يناسبه. نبقي هنا المهمة ذات فئة واحدة وموسمين حتى يكون معنى البسط والمقام واضحا.

كيف نحسب النسبة في ست حالات؟

الجدول من إنشاء الكاتب؛ ص 1 وص 2 وص 3 وص 5 تتطابق فيها الفئة، بينما ص 4 وص 6 تختلفان. نعطي المطابقة العدد 1 والاختلاف 0 عند العد، وليس عند ترميز أسماء الفئات.

المجموع أربع مطابقات؛ المقام ست حالات. لذلك تكون النسبة أربعة مقسومة على ستة، أي نحو 66.7 ٪. وتقابلها حالتان مختلفتان من ست، أي نحو 33.3 ٪، مع تقريب العرض إلى منزلة عشرية.

هذا حساب التطابق المرصود على الجدول المحدد. لا ننسب الاختلاف إلى موسم معين بوصفه مخطئا، لأن الجدول لا يتضمن مرجعا مستقلا يحدد الفئة الصحيحة.

الصورةالموسم أالموسم بالتطابق
ص 1دائرةدائرةنعم
ص 2مستطيلمستطيلنعم
ص 3دائرةدائرةنعم
ص 4مستطيلدائرةلا
ص 5مستطيلمستطيلنعم
ص 6دائرةمستطيللا

لماذا نربط الأحكام بمعرفاتها؟

قد يرتب ملف الموسم أ الصور بحسب المعرف، ويرتب ملف ب بحسب وقت المراجعة. إذا قارنا الصف الأول بالصف الأول دون معرف، فقد نضع حكم ص 1 بجانب حكم صورة أخرى، فنحسب تطابقا أو اختلافا لا يخص الحالة نفسها.

نقترح فحص المعرف وإصدار الصورة وقائمة الفئات والدليل المستخدم قبل العد. وقد يكون المعرف ثابت الاسم لكن الصورة عدلت؛ عندئذ لا يكفي تطابق الاسم لافتراض أن الاثنين راجعا المادة نفسها.

نحتفظ بجدول الأزواج الذي بنيت عليه النسبة، كي يستطيع المراجع معرفة أي أربع حالات عدت متطابقة. أما مشكلة البيانات التي لا يملك كلا الموسمين حكما عليها فتحتاج وصفا منفصلا للتغطية، بدلا من اختراع حكم مفقود.

ماذا نستنتج من الاتفاق وماذا يبقى مجهولا؟

تميز دراسة Artstein وPoesio بين اتفاق الموسمين وصلاحية مخطط الوسم؛ فالاتفاق الجيد لا يضمن مطابقة الحكم للحقيقة. [1]

تساعد الأربع مطابقات في وصف اتساق القرارات المسجلة، لكنها لا تعطينا أربع صور صحيحة بالضرورة. وفي الحالتين المختلفتين نعرف موضع الخلاف فقط؛ نحتاج مراجعة الدليل والمادة أو مرجعا مناسبا لسؤال الصحة.

كما لا نعمم 66.7 ٪ على صور لم تدخل الحساب أو نعدها أداء نموذج. نقترح الإبلاغ عن عدد الحالات واختيارها والفئات واستقلال الأحكام وإصدار الدليل مع النسبة، وإبقاء فحص صحة المرجع وتقييم النموذج سؤالين منفصلين.

المصادر ومتابعة القراءة

  1. Artstein and Poesio: Inter-Coder Agreement for Computational Linguistics (2008) (يفتح في نافذة جديدة)aclanthology.org

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.