تقنية

تصنيف الصور بأسماء جديدة: ماذا تقرر قائمة الفئات؟

صورة علبة وقائمة ناقصة تنتجان مقارنة افتراضية تنتهي بفحص غياب الاسم المناسب
مخطط من إعداد بحر العلوم؛ يوضح نقص الخيارات دون نتيجة نموذج فعلية.

تصنيف الصور بأسماء جديدة يسمح باختبار أوصاف لفئات دون تدريب إضافي خاص بالقائمة الجديدة، في نموذج يدعم المهمة. يصف Hugging Face نماذج تعلمت تمثيلات رؤية ولغة من صور وأوصاف، وتستقبل الصورة مع أسماء مرشحة. [1] نميز اختيار الأعلى ضمن قائمة من التحقق من ماهية الشيء الظاهر.

الخلاصة السريعة

راجع أسماء الفئات ومعانيها وما تغطيه قبل تفسير النتيجة؛ اختيار وصف من قائمتك لا يضمن أن القائمة تشمل الوصف الصحيح.

  • عدم التدريب الإضافي على الفئات الجديدة لا يعني أن النموذج لم يدرب من قبل؛ الوصف المذكور يستعمل تمثيلات تعلمها من صور ونصوص. [1]
  • في المسار الموثق تدخل أسماء مرشحة بصياغة نصية، وتنتج درجات مرتبطة بهذه الأسماء؛ نراجع القائمة لا الصورة وحدها. [1]
  • إذا كانت الصورة في مثالنا لعلبة، والقائمة «كوب» و«كرة»، فالأعلى بينهما لا يجعل العلبة كوبا أو كرة.
  • افحص الصورة والمعنى المرئي للصفات؛ لا تفترض دقة عربية أو غياب جميع البدائل لمجرد أن اسما حصل على أعلى درجة.

ما معنى عدم إضافة تدريب لهذه القائمة؟

توضح الوثيقة أن هذا النوع من التصنيف يستفيد من تعلم تمثيلات مرتبطة للصور والنصوص، ويمكنه استعمال أوصاف فئات جديدة دون أمثلة تدريب إضافية خاصة بها. [1] المقصود تغيير قائمة الوصف عند الاستخدام، لا بدء نموذج بلا معرفة أو تحويل كل لفظ إلى فئة يتقنها.

نفترض أن مسؤول مكتبة صور يريد فرز صور أوعية مكتبية. يختار أولا أسماء «علبة» و«كوب» و«سلة». قبل استعمالها، يكتب الفرق العملي الذي يريد مراجعته في الصور؛ لا يعد هذه الأسماء نتيجة اكتشاف آلي لكل الأنواع الموجودة في المكتبة.

أين يدخل وصف الفئة في العملية؟

يستقبل المثال الموثق أسماء مرشحة، ويحوّلها إلى عبارات تصف صورة قبل المقارنة، ثم يخرج درجات مع أسماء الفئات. [1] لذلك يكون اختيار الكلام نفسه جزءا من المدخل، وليس ملصقا نضيفه بعد صدور حكم مستقل عن القائمة.

في تصميمنا، نفرق بين «علبة مفتوحة» و«علبة مغلقة» إذا كان هذا الفرق مطلوبا للفرز. ولا نضيف وصف «علبة فارغة» إلى كل صورة مغلقة؛ المحتوى غير الظاهر لا يصبح فارغا بالاسم. نراجع معنى الصفات مع صاحب المكتبة قبل اختبار قدرة النموذج على تمييزها.

ماذا لو غاب الاسم المناسب؟

نضع صورة مفترضة لعلبة أمام قائمة ناقصة لا تتضمن إلا «كوب» و«كرة». لو رجع المسار بدرجات لهذين الاسمين فقط، لا نستنتج أن أعلى الاسمين صحيح. لقد طلبنا منه المقارنة داخل خيارات لم تسم العلبة، فقرار قبول الاسم يحتاج قراءة مستقلة للصورة.

لم نشغل هذا المثال أو نحدد أي الاسمين سيتصدره. نقترح الاحتفاظ بحالة «لم يتأكد التصنيف» عند مراجعة المرشحين، والعودة إلى تعريف الفئات إذا ظهر نقص. إضافة اسم جديد تحتاج بدورها تجربة وتحققا؛ لا نقدمها ضمانا بأن كل صورة ستصنف سليما.

ما الذي تفحصه قبل استعمال الفرز؟

في مراجعة مقترحة، نختار صورا نعرف صفاتها المرئية ونثبت قائمة الأوصاف والنموذج والإعداد. نسجل أين اختلف القرار عن الصورة أو عن تعريفنا للفئة. تغيير كلمة ثم رؤية ترتيب مختلف لا يكفي وحده لقول إن التصنيف الجديد أدق في جميع الحالات.

كما لا نحول درجات الاختيار إلى احتمالات صحة عامة لمحتوى الصورة، ولا نستنتج أن الوصف العربي يعمل كالإنجليزي في أي نسخة. المقال يوضح أين تحدد القائمة مساحة الاختيار، دون تدريب نموذج أو قياس أداء أو إعلان أن قائمة بعينها صالحة لكل مكتبة.

المصادر ومتابعة القراءة

  1. Hugging Face: Zero-shot image classification (يفتح في نافذة جديدة)huggingface.co

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.