جميع المقالات (الصفحة 93)

قراءات عربية في العلوم والتقنية والطبيعة والثقافة، تبدأ بسؤال وتترك لك مساحة للاستكشاف.

2302 مقال

تقنية

Dropout: هل تسقط النسبة نفسها في كل مرور؟

Dropout في التدريب والتقييم يغير طريقة التعامل مع قيم التنشيط في الوحدة المحددة. أثناء التدريب تصفر nn.Dropout عناصر باحتمال p، وتحجّم المخرجات بعامل 1 ÷ (1 − p)؛ أثناء التقييم تكون الوحدة دالة هوية. [1]

3 دقائق قراءةمصدر واحد

تقنية

BatchNorm: لماذا تغير الدفعة خرج القيمة نفسها؟

إحصاءات BatchNorm ليست وصفًا للقيمة منفردة. في BatchNorm1d تحسب الوحدة متوسط القناة وتباينها في الدفعة أثناء التدريب؛ وعند تتبع الإحصاءات الجارية تستعمل المخزن الجاري في التقييم. [1]

3 دقائق قراءةمصدر واحد

تقنية

LayerNorm: أي أبعاد تدخل متوسط المثال؟

أبعاد LayerNorm تتحدد من normalized_shape: تحسب الوحدة المتوسط والتباين على الأبعاد الأخيرة التي يحددها هذا الشكل. لا يكفي اسم LayerNorm للقول إن محورًا معينًا مستبعد من الحساب. [1]

3 دقائق قراءةمصدر واحد

تقنية

عمق الشبكة وعرضها: كيف تعد المعاملات فعلًا؟

عدد معاملات الشبكة يتحدد من أشكال طبقاتها وإعداداتها، لا من وصف «عميقة» أو «عريضة» وحده. في nn.Linear موثقة، شكل الأوزان out_features × in_features، ويضاف متجه إزاحة بطول out_features عند تفعيله. [1]

3 دقائق قراءةمصدر واحد

تقنية

الشبكة المتكررة: هل حالة الزمن وزن جديد؟

الحالة المخفية في RNN تتغير مع المدخل الحالي والحالة السابقة، بينما يعاد استعمال معاملات الطبقة في خطوات التسلسل. تعرض شفرة PyTorch هذه العلاقة مع تنشيط Tanh أو ReLU. [1]

3 دقائق قراءةمصدر واحد

تقنية

التوقف المبكر: أي نسخة تعيدها قاعدة التحسن؟

التوقف المبكر واستعادة الأوزان خياران مترابطان لكنهما مختلفان: الأول يقرر متى ينتهي التدريب، والثاني يحدد نسخة الأوزان النهائية. سنقرأ قاعدة قبول التحسن في تنفيذ Keras محدد، لا نستنتجها من اسم «الأفضل» وحده.

3 دقائق قراءةمصدران

تقنية

نقطة حفظ التدريب: أوزان أم حالة استئناف؟

حفظ حالة استئناف التدريب يبدأ بتحديد ما سيحتاجه العمل التالي. تحميل قيم النموذج لإنتاج مخرج يختلف عن متابعة تدريب يعتمد أيضًا على حالة المحسن ومكان التوقف. سنفحص محتويات سجل توضيحي، دون إنشاء ملف نموذج أو تشغيله.

3 دقائق قراءةمصدر واحد

تقنية

مجموعات المحسن: أي معدل تعلم يخص هذا المعامل؟

مجموعات المعاملات ومعدل التعلم تحتاج إلى قائمة عضوية واضحة: ما المعامل الذي ينتمي إلى كل مجموعة، وأي إعداد تجاوز القيمة العامة؟ ليست تسمية «قاعدة» و«رأس» كافية لتحديد الأرقام التي يقرأها المحسن في خطوته.

3 دقائق قراءةمصدران

تقنية

DDP: من يقسم البيانات ومن يزامن التدرج؟

DDP وتقسيم المدخلات ليسا وعدًا واحدًا. تصف PyTorch الحاوية بأنها تزامن تدرجات نسخ النموذج، وتنبه إلى أنها لا تجزئ المدخل عبر الأجهزة بنفسها؛ يحدد المستخدم توزيع البيانات، مثل اختيار موزع مناسب. [1]

3 دقائق قراءةمصدر واحد

تقنية

توازي النموذج: ما الذي يعبر بين جزأين؟

توازي النموذج وتقسيم الطبقات يمكن أن يضعا أجزاء مختلفة من الحساب على أجهزة مختلفة. في تقسيم المراحل الموثق، تملك المرحلة جزءها ومعاملاته، وتتواصل المراحل لنقل القيم اللازمة. [1]

3 دقائق قراءةمصدر واحد

تقنية

توازي خط الأنابيب: لماذا تنتظر بعض المراحل؟

توازي خط الأنابيب والدفعات الصغيرة يرتب أجزاء مختلفة من النموذج لتعمل على دفعات مختلفة في وقت واحد، مع بقاء اعتماد كل دفعة على ناتج المرحلة السابقة. يصف بحث GPipe هذا التداخل. [1]

3 دقائق قراءةمصدر واحد