تقنية

النزول المتدرج العشوائي: لماذا قد ترتفع الخسارة بعد خطوة؟

مخطط يبين انخفاض خسارة المثال المختار مع ارتفاع متوسط خسارتي المثالين بعد التحديث
الهدف الكلي وخسارة المثال المختار كميتان مختلفتان.

يستخدم النزول المتدرج العشوائي تدرج مثال مختار بدل حساب تدرج جميع الأمثلة في كل تحديث؛ الاختيار المنتظم يعطي تقديرًا غير متحيز عند نقطة ثابتة. [1]

الخلاصة السريعة

قد يخفض تحديث SGD خسارة المثال المختار ويرفع الخسارة الكلية في الخطوة نفسها؛ متوسط الاتجاه عبر الاختيارات لا يضمن نجاح كل اختيار منفرد.

  • إذا عرّفنا الهدف متوسط خسائر الأمثلة، يكون تدرجه متوسط تدرجاتها المحسوبة عند المعلمات نفسها. [1]
  • لخسارتين (w−1)² و(w−5)² عند w=3، التدرجان 4 وسالب 4؛ متوسطهما صفر، ومتوسط الخسارة 4.
  • بمعدل 0.25 واختيار المثال الأول، تصبح w=2؛ تنخفض خسارته من 4 إلى 1، لكن الخسارة الكلية ترتفع من 4 إلى 5.
  • اختيار كل مثال باحتمال نصف عند w=3 يجعل متوسط التدرج صفرًا؛ عدم التحيز عند نقطة ثابتة لا يعني أن كل خطوة تقلل الهدف. [1]

حدد هدف المجموعة أولًا

لدينا مثالان افتراضيان فقط، ووزن واحد w. نجعل خسارة الأول مربع (w ناقص واحد)، وخسارة الثاني مربع (w ناقص خمسة). نعرّف الهدف بأنه متوسط الخسارتين بالتساوي، دون أوزان إضافية.

عندما يكون الهدف متوسط خسائر الأمثلة، يكون تدرجه متوسط تدرجاتها عند المعلمات نفسها. في SGD نستبدل هذا المتوسط بتدرج مثال مختار. [1]

وجود اسم «الخسارة» على الرسم لا يخبرنا أيهما عرض: خسارة المثال الحالي أم الهدف الكلي. في قصتنا نحتفظ بالقيمتين؛ بهذه الطريقة نستطيع تفسير انخفاض أحدهما وارتفاع الآخر دون تناقض.

التدرجان يتعاكسان عند المنتصف

نبدأ عند w يساوي ثلاثة. خسارة الأول أربعة وخسارة الثاني أربعة، فيكون متوسطهما أربعة. مشتقة خسارة الأول ضعف (w ناقص واحد)، ومشتقة الثاني ضعف (w ناقص خمسة).

عند هذه البداية، تعطي المشتقتان أربعة وسالب أربعة. متوسطهما صفر؛ لذا تبقى w عند ثلاثة في خطوة التدرج الكامل العادية لهذا الهدف. ويمكن كتابة الهدف (w ناقص ثلاثة) تربيع زائد أربعة، فتظهر قيمته الدنيا.

ذلك لا يجعل تدرج كل مثال صفرًا. الأول يدفع نحو واحد والثاني نحو خمسة، لكن المطلوب متوسط الخسارتين. السؤال عن مثال منفرد غير السؤال عن أفضل قيمة وسطية لهما في هذا التعريف.

خطوة جيدة للمثال ومكلفة للمتوسط

نختار المثال الأول في خطوة توضيحية، بمعدل 0.25. نطرح 0.25 مضروبًا بأربعة من ثلاثة، فتصير w اثنين. خسارة الأول تصبح واحدًا، أي تنخفض ثلاثة.

خسارة الثاني عند اثنين هي مربع سالب ثلاثة، أي تسعة. متوسط واحد وتسعة هو خمسة؛ ارتفع الهدف الكلي من أربعة إلى خمسة رغم تحسن المثال المختار. لم ننفذ تدريبًا؛ الحساب يعزل تحديثًا واحدًا.

ولو اخترنا المثال الثاني عند البداية القديمة نفسها، لصارت w أربعة. تنعكس خسارتا المثالين إلى تسعة وواحد، ويبقى المتوسط خمسة. يتيح هذا التناظر مقارنة الاختيارين دون سلسلة تحديثات تتغير فيها نقطة الحساب.

عدم التحيز ليس ضمان كل خطوة

عند اختيار الأمثلة بالتساوي، يساوي التوقع لتدرج المثال تدرج الهدف عند المعلمات الثابتة. [1] في مثالنا عند ثلاثة، نصف أربعة زائد نصف سالب أربعة يساوي صفرًا.

لكننا حسبنا أيضًا أن كلًا من الخطوتين المفترضتين يرفع الهدف إلى خمسة. متوسط المعلمتين الجديدتين اثنين وأربعة يساوي ثلاثة، أما متوسط خسارتيهما الكليتين فيساوي خمسة. متوسط موضعين لا يساوي بالضرورة خسارة متوسطهما.

لذلك لا تقرأ الوصف غير المتحيز بوصفه وعدًا بالتحسن في كل تحديث. سجل سياسة الاختيار ومعدل الخطوة والهدف الذي تراقبه. وعندما تقارن تحديثين، ثبّت نقطة بدايتهما إذا أردت عزل أثر المثال المختار بدل خلطه بأثر التحديث السابق.

المصادر ومتابعة القراءة

  1. Dive into Deep Learning: Stochastic gradient descent (يفتح في نافذة جديدة)d2l.ai

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.