تقدر One-Class SVM حدًا لبياناتها المرجعية دون الحاجة إلى تسميات فئتين في fit. يقع مخرج دالة القرار الموجب داخل الحد والسالب خارجه. [1]
الخلاصة السريعة
الخروج من حد One-Class SVM وصف بالنسبة إلى النموذج المرجعي؛ لا يحدد اسم فئة ثانية ولا سبب اختلاف الحالة.
- يدرب fit الحد من العينات؛ يتجاهل الوسيط y، فلا تعني عبارة أحادية الفئة تدريب تصنيف عادي بتسميتين. [1]
- عند درجات خام مفترضة 0.7 و 1.2 و 1.7 وإزاحة 1، تكون دالة القرار سالب 0.3 ثم 0.2 ثم 0.7.
- مع ثبات الدرجات الخام، تغير الإزاحة القرار المفترض؛ إعادة التدريب قد تغيرهما معًا، ولا يفسر الطرح سبب الحالة.
- nu حد أعلى لنسبة أخطاء التدريب وحد أدنى لنسبة متجهات الدعم؛ ليس احتمالًا لكل حالة جديدة ولا نسبة خروج مستقبلية مضمونة. [1]
ما الذي تتعلمه الفئة الواحدة؟
تأمل سجلًا مرجعيًا لخصائص قطع صنعت في ظروف محددة. نريد مقارنة قطع لاحقة بهذا السجل، ولا نملك تسميات لعدة أسباب محتملة للاختلاف. هذا سؤال مختلف عن اختيار اسم بين فئتين معروفتين مسبقًا.
في واجهة المكتبة، يستقبل fit العينات ويقدر حدًا لها، ويتجاهل y الموجود لتناسق الواجهة. [1] لذلك لا نصنع فئة ثانية بمجرد كتابة قائمة تسميات لا يستخدمها هذا المسار.
وفي المثال التفسيري نفترض أن السجل يمثل الحالة المرجعية المطلوبة. إذا ضممنا إليه حالات لا نريد اعتبارها مرجعية، تغير السؤال الذي يتعلمه الحد. توثيق مصدر العينات يسبق تسمية ما يقع خارجه.
الدرجة الخام ليست دالة القرار
توضح المكتبة العلاقة: دالة القرار تساوي score_samples ناقص offset_. إشارة القرار موجبة للداخل وسالبة للخارج. [1]
نفترض ثلاث درجات خام فقط: 0.7 و 1.2 و 1.7، مع إزاحة واحد. نطرح الواحد فنحصل على سالب 0.3، ثم 0.2، ثم 0.7. الأولى خارج الحد، والأخريان داخله وفق هذه الأرقام.
لم نحسب هذه الدرجات من نواة أو بيانات تدريب؛ اخترناها لعزل الطرح. ولو عرضت الدرجات الخام الثلاث وحدها، لوجدتها موجبة جميعًا، وربما أعلنت الحالات كلها داخل الحد خطأ. القرار يتطلب الإزاحة أيضًا.
ماذا يبين تغيير الإزاحة وحده؟
نرفع الإزاحة المفترضة إلى 1.5 ونثبت الدرجات الخام. تصبح النتائج سالب 0.8 وسالب 0.3 و 0.2. انتقلت الحالة الوسطى إلى الخارج في هذا الحساب، مع أن درجتها الخام بقيت 1.2.
هذه مقارنة حسابية بين عتبتين مفترضتين، وليست وصفًا لما يحدث تلقائيًا عند تغيير إعداد التدريب؛ إعادة الملاءمة قد تغير الدرجات والإزاحة معًا. لا ننقل نتيجة تثبيت أحدهما إلى تجربة تغير كليهما.
كذلك لا يعني القرار السالب أن القطعة مكسورة. ربما تغيرت ظروف القياس أو ظهر نوع مشروع جديد. يحتاج تفسير الحالة إلى سجلها ووصف خصائصها؛ طرح الإزاحة يحدد الجانب من الحد فقط.
ماذا تعني nu وما الذي لا تستنتجه؟
تصف الوثائق nu بأنها حد أعلى لنسبة أخطاء التدريب وحد أدنى لنسبة متجهات الدعم، ضمن المجال الأكبر من صفر وحتى واحد. [1]
المتجه الداعم يسهم في وصف الحد، وليس مرادفًا لكل عينة خاطئة. لذلك لا نجمع النسبتين، ولا نستنتج أن كل متجه داعم يقع خارج المنطقة. الاسمان يشيران إلى دورين مختلفين في النموذج.
إذا قرأت إعدادًا nu يساوي 0.1، فلا تكتب أن احتمال خروج القطعة التالية عشرة بالمئة. ذلك يبدل وصفًا للتدريب بوعد عن بيانات مستقبلية. احتفظ بالإعداد، ووصف السجل المرجعي، واسم مخرج القرار، وافحص معنى الحالة قبل تحويله إلى إجراء.
المصادر ومتابعة القراءة
- scikit-learn: OneClassSVM (يفتح في نافذة جديدة)scikit-learn.org
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
