وحدة وسم البيانات تحدد الشيء الذي نعطيه التسمية: الصورة كاملة أم كائنا فيها أم منطقة مختارة. قد تحتوي صورة واحدة على سجلين مكانيين، مع بقاء عدد الصور واحدا. يهم هذا الفرق عند إعداد مرجع لتعلم الآلة، لأن عدد الوسوم لا يشرح وحده عدد المدخلات أو ما تمثله كل تسمية.
الخلاصة السريعة
حدد وحدة الوسم قبل عد السجلات؛ إذا اخترنا وسما مستقلا لكل كائن ظاهر، فقد تنتج صورة واحدة سجلين لكائنين من دون أن تصبح صورتين.
- تتيح CVAT وسوم الإطار، كما تتيح وسم الكائنات بمربعات إحاطة. [1] [2] اختر المستوى الذي يخدم المهمة، ولا تفترض أن كل وسم يخص الصورة كلها.
- في المشهد المولد قطعتان منفصلتان ظاهرتان: كتلة مستطيلة وأسطوانة؛ سياستنا التعليمية تختار وسما واحدا للصورة أو سجلين للكائنين، بحسب المهمة.
- سجل الكائن يحتاج ربطا بالصورة وفئة وموقعا معرفا، بينما وسم الصورة لا يعطي تلقائيا حدود كل كائن داخلها.
- عد الصور وسجلات الوسم كلّا على حدة، وراجع تغطية الكائنات المطلوبة؛ تعدد السجلات من الصورة نفسها لا يجعلها صورا مستقلة.
أي مستوى نعطيه التسمية؟
تصف وثائق CVAT الوسم بالعلامات على مستوى الإطار، وتشرح أداة أخرى لوضع مربع إحاطة حول كائن. [1] [2]
نقترح مهمة أولى تختار للصورة كلها تسمية واحدة «مشهد قطع تعليمية». ونقترح مهمة ثانية تحدد كل قطعة ظاهرة على حدة مع فئتها ومكانها. هاتان سياستان للمثال، وليستا وعدا بأن كل أداة أو مهمة تسمح بتسمية واحدة فقط للصورة.
في المهمة الأولى نجيب عن وصف الإطار كله. وفي الثانية نحتاج معرفة إلى أي جزء يشير كل سجل. قبل كتابة دليل الوسم، نختار السؤال المطلوب حتى لا نحمل تسمية عامة معنى تحديد موقع لم تسجله.
كم سجلا نختار للمشهد المعروض؟
الصورة داخل المقال مشهد توضيحي مولد، شاهدنا فيه يدويا كتلة مستطيلة على اليسار وأسطوانة قائمة على اليمين، مع فراغ بينهما. نستخدمها لتوضيح وحدة العمل؛ لا نوثق بها تجربة تصوير أو اختبار نموذج.
نسمي هذه الصورة في مثالنا ص 1. إذا طبقنا السياسة الأولى نحفظ تسمية واحدة للإطار. وإذا طبقنا السياسة الثانية، نخطط لسجل ك 1 للكتلة وسجل ك 2 للأسطوانة. لا يتغير عدد ملفات الصور بسبب هذا الاختيار.
| المهمة التعليمية | عدد الصور | وحدة السجل | عدد السجلات المختار |
|---|---|---|---|
| تسمية الإطار كله | 1 | الصورة ص 1 | 1 |
| تحديد القطعتين | 1 | كائن ظاهر في ص 1 | 2 |

ما الذي يربط السجل بالكائن؟
تشرح أداة مستطيلات CVAT طريقة تعتمد نقاط الكائن القصوى لتحديد الإحاطة. [2]
في السجل المقترح نحتاج معرف الصورة ومعرف الكائن والفئة وتعريف الموضع. إذا اخترنا مستطيلا، نحدد اتفاقية إحداثياته ووحدة الموضع وأبعاد الصورة التي يعود إليها. لا نأخذ حجم القطعة الحقيقي بالسنتيمتر من شكل ذلك المستطيل.
الصورة المعروضة خالية من مربعات مرسومة. سجلانا ك 1 وك 2 تصميم تعليمي لما يمكن وسمه، ولم نقدم إحداثيات محسوبة أو ندع تشغيل أداة. الفكرة أن كلمة «أسطوانة» وحدها لا تحفظ مكان الأسطوانة إذا احتوت صور أخرى عدة مثيلات.
كيف نكتب الحجم والتغطية بوضوح؟
نقترح وصفا مثل «صورة واحدة، وسجلان مقترحان للكائنات، وفق سياسة تشمل القطعتين الظاهرتين». يوضح ذلك وحدة العد بدل الاكتفاء بعبارة «عنصران موسومان». وعند التنفيذ الفعلي نراجع أن كل سجل يربط بمعرفه الصحيح وأن نطاق التغطية يوافق التعليمات.
قد تقصد مهمة أخرى وسم الأسطوانات فقط، فتكون الكتلة خارج نطاقها. لذلك لا يثبت عدد السجلات وحده اكتمال الوسم؛ نحتاج معرفة الكائنات المطلوبة في الدليل.
كما تبقى السجلات المشتقة من ص 1 مرتبطة بالصورة نفسها. لا نعرضها كصورتين مستقلتين عند وصف التنوع، ولا نستنتج جودة تدريب من زيادة عدد السجلات. نوضح أولا ما الذي وسمناه وكيف ربطناه بالمدخل.
المصادر ومتابعة القراءة
- CVAT: Annotation with tags (يفتح في نافذة جديدة)docs.cvat.ai
- CVAT: Annotation with rectangles (يفتح في نافذة جديدة)docs.cvat.ai
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
