التضمين النصي يحول النص إلى قائمة أرقام تستخدم في البحث والمقارنة. في تكامل Azure AI Search، ينص التوثيق على استعمال نموذج التضمين نفسه للمحتوى عند الفهرسة وللسؤال عند البحث. [1] نركز هنا على توافق الطرفين؛ تطابق عدد الأرقام وحده لا يبين أنها تحمل المعنى نفسه.
الخلاصة السريعة
راجع النموذج والإعدادات التي أنتجت تمثيل السؤال والمحتوى، واتبع متطلبات مساريهما المتوافقين؛ لا تخلط متجهات نماذج مختلفة لمجرد تشابه طولها.
- حدد نموذج الطرفين؛ التوثيق المذكور يشترط نموذج التضمين نفسه في مساري المحتوى والسؤال داخل ذلك التكامل. [1]
- عدد الأبعاد المتساوي ليس دليلا كافيا على توافق المعنى؛ احتفظ بمعلومات النموذج والإعدادات مع التمثيل.
- اتبع طريقة السؤال والمستند التي يحددها النموذج؛ قد يختلف التوجيه المطلوب لكل طرف مع بقائهما زوجا متوافقا. [2]
- عند تغيير النموذج راجع التمثيلات والمقارنة من جديد؛ انتظام الأرقام أو تشغيل الطلب لا يثبت جودة الاسترجاع.
أي نموذج أنتج هذه الأرقام؟
نفترض مجموعة ملاحظات عن صناعة مشهد ورقي، حولت إلى تمثيلات باستخدام نموذج نسميه أ. ثم حول السؤال عن المظلة بنموذج آخر نسميه ب. لم نولد هذه المتجهات فعليا، والأسماء لا تشير إلى منتجات. قبل مقارنة النتائج نحتاج أن نعرف هل صمم الطرفان للعمل في فضاء متوافق.
في التكامل الذي يصفه المصدر، يختار المسؤول نموذج تضمين واحدا لمساري السؤال والمحتوى. [1] لا نعمم ذلك على جميع الأنظمة متعددة المرمزات؛ قد يصمم نظام مختلف طرفين متوافقين، لكن توافقهما يحتاج مواصفاته. مجرد أن واجهتين تعيدان أرقاما لا يثبت أن الأرقام صالحة للمقارنة المقصودة.
لماذا لا يكفي أن تكون القائمتان بالطول نفسه؟
نستخدم تشبيها محدودا: قائمتان تصفان صندوقا برقمين، لكن الأولى مرتبة «العرض ثم الارتفاع»، والثانية «الارتفاع ثم العرض». اتفاق الطول لا يخبرنا ترتيب المعنى. متجهات التضمين ليست قياسات عرض وارتفاع، ولا نسمي أبعادها بهذه الأسماء؛ التشبيه يوضح فقط أن عدد الخانات لا يكفي.
لذلك لا نخترع حلا بتبديل رقمين في متجه حقيقي. نقترح مراجعة اسم النموذج وإصداره وطريقة إعداد النص والإعدادات اللازمة بدلا من قراءة كل بعد بوصفه كلمة مستقلة. نحتفظ أيضا بالنص الأصلي، لأن القائمة العددية وحدها لا تعرض للقارئ المعلومة التي يريد التحقق منها.
هل يجب أن يعالج السؤال والمستند بالطريقة نفسها؟
يفرق توثيق Sentence Transformers بين طريقتي ترميز السؤال والمستند، وقد تستعملان توجيهات أو مسارات مهمة مخصصة؛ وللنماذج التي لا تستعمل هذا التخصيص تكونان مماثلتين للترميز العام. [2] المطلوب اتباع التصميم المتوافق، وليس فرض نص إعداد واحد على كل نموذج.
في مثالنا، السؤال قصير والملاحظة فقرة طويلة. إذا طلب النموذج توجيها للسؤال وآخر للمستند، نسجل هذا الفرق ونطبقه في موضعه. لا ننسخ توجيه المستند إلى السؤال كي نجعل المدخلات متطابقة شكليا؛ مساواة الشكل قد تخالف المسارين اللذين صمما للمهمة.
ماذا نراجع عندما يتغير النموذج؟
إذا انتقلنا من أ إلى ب، نراجع كيف أنتجت تمثيلات المجموعة وكيف ستقارن بالأسئلة الجديدة. قد يلزم توليد تمثيلات جديدة للمحتوى، أو مسار انتقال موثق يضمن توافق الطرفين؛ لا نفترض أن تعديل اسم النموذج في جانب السؤال يكمل الانتقال كله.
ثم نراجع أسئلة فعلية من المجموعة وموادها المرجعية وفق مهمة البحث، دون اعتبار نجاح إرسال الطلب دليلا كافيا. لم نختبر نموذجين هنا أو نقارن كلفة وأداء. الغرض توضيح أن التمثيل جزء من تصميم المقارنة، وأن تغيير منتجه قد يغير شروطها حتى إذا ظلت قائمة الأرقام مرتبة ومقبولة شكليا.
المصادر ومتابعة القراءة
- Microsoft Learn: Configure a vectorizer in Azure AI Search (يفتح في نافذة جديدة)learn.microsoft.com
- Sentence Transformers: Usage (يفتح في نافذة جديدة)sbert.net
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
