تقنية (الصفحة 38)

أفكار وأدوات رقمية بلغة مفهومة.

1201 مقال

تقنية

سجل مقياس التدريب: هل القيمة المعروضة هي الأفضل؟

سجل مقياس التدريب في MLflow قد يحتوي قيمًا متعددة للاسم نفسه. سؤال عرض قيمة واحدة يختلف عن استرجاع التاريخ ومراجعته. سنطبق القاعدة المكتوبة في مرجع REST على سجل خسارة مؤلف، ولا ننسب الناتج إلى خادم شغلناه أو إلى كل واجهة عميل.

3 دقائق قراءةمصدر واحد

تقنية

خطوة LBFGS: هل حسابات الخسارة هي تحديثات الوزن؟

عدد حسابات الخسارة في خطوة LBFGS ليس اسمًا آخر لعدد مرات تغيير الوزن. تحدد الوثائق step يستقبل closure تعيد تقييم النموذج وتعيد الخسارة، وتفصل حد التكرارات من حد تقييم الدالة. [1] نصنع سجلًا حسابيًا يميز هذه الوحدات دون تشغيل المحسن.

3 دقائق قراءةمصدر واحد

تقنية

كشف خلل التدرج: هل traceback يثبت سبب الخطأ؟

كشف خلل التدرج في PyTorch يساعد على تحديد موضع للمراجعة، لكنه لا يثبت وحده السبب الكامل للخلل. تصف detect_anomaly أثر تفعيلها أثناء المرور الأمامي، وفحص NaN الناتجة في الحساب العكسي. [1] نراجع حدود تسجيل افتراضي، ولا ننشئ خطأ تدريب حقيقيًا.

3 دقائق قراءةمصدر واحد

تقنية

مشاركة المعامل: هل اسمان يعنيان وزنين مستقلين؟

مشاركة المعاملات في PyTorch تتعلق بكائن المعامل الذي تشير إليه الأسماء، لا بتشابه أرقامه وحده. تعرض named_parameters الاسم والمعامل، ويضبط remove_duplicate إزالة المعاملات المكررة. [1] نراجع هوية كائنات معلنة لنرى لماذا لا يكفي جمع أحجام الأسماء لحساب عدد الأوزان الفريدة.

3 دقائق قراءةمصدر واحد

تقنية

اختيار النموذج في GridSearchCV: هل أعلى مقياس هو القرار الوحيد؟

يمكن تخصيص refit callable لاختيار النموذج في GridSearchCV بقاعدة تعيد فهرس صف من cv_results_، بدل الاكتفاء بأعلى درجة منفردة. [1] سنعلن شروط اختيار وصفوفًا تعليمية ثم نحسب الصف المختار، دون بحث فعلي أو توقيت نموذج أو ادعاء أفضلية خارج القاعدة.

3 دقائق قراءةمصدر واحد

تقنية

ParameterGrid: هل تجمع كل الإعدادات في شبكة واحدة؟

شبكات المعاملات الشرطية تبدأ من سؤال المعنى: هل ينطبق هذا الإعداد على كل اختيار للنموذج؟ قد ينشئ ضرب القوائم معًا أسماء لتركيبات كثيرة، بينما بعضها يكرر حالة واحدة بلا أثر. نرتب مثالًا صغيرًا قبل البحث، ثم نميز قائمة المرشحين من عدد التجارب الفعلية.

3 دقائق قراءةمصدر واحد

تقنية

ParameterSampler: هل عدد السحوبات هو عدد إعدادات مختلفة؟

عند قراءة ParameterSampler والإرجاع، لا تعامل ثلاث سحوبات تلقائيًا على أنها ثلاثة مرشحين مختلفين. يربط التوثيق طريقة المعاينة بنوع القيم التي قدمتها. نعلن مجموعتين صغيرتين ونعد الهويات في سجلهما يدويًا، دون توليد عشوائي أو تشغيل بحث عن نموذج.

3 دقائق قراءةمصدر واحد

تقنية

TPE: هل نسبة الكثافتين هي أداء النموذج المتوقع؟

نسبة الكثافتين في TPE تساعد على فهم كيف يقترح البحث إعدادًا تالياً. لكن الرقم الناتج من القسمة ليس خسارة النموذج أو نسبة نجاحه. نفحص جدول كثافات صغيرًا من إعدادنا لنرى لماذا قد يفوز اقتراح لا يملك أكبر كثافة منفردة، دون تشغيل Optuna أو ملاءمة توزيع.

3 دقائق قراءةمصدر واحد

تقنية

التنصيف المتتابع: لماذا يقل المرشحون وتكبر موارد كل منها؟

موارد التنصيف المتتابع تجيب عن سؤالين متعاكسين في الاتجاه: كم مرشحًا يبقى، وكم نعطي كل واحد؟ لو قلت «زادت الميزانية» دون تحديد الوحدة، فقد تخلط عدد الحالات بكلفة كل حالة. نراجع جدولًا تعليميًا ثم حدود نقله إلى HalvingGridSearchCV.

3 دقائق قراءةمصدر واحد

تقنية

Hyperband: هل تبدأ الجولات بعدد المرشحين والموارد نفسه؟

جولات Hyperband وميزانيتها لا تختزل إلى جدول تنصيف واحد. تعرض الخوارزمية أكثر من بداية: مرشحون كثيرون بموارد قليلة، أو عدد أصغر بموارد أكثر. نحسب ثلاث جولات من معادلات الورقة لميزانية مصغرة، ونفصل مواضع المرشحين عن هوياتهم وكلفة الجهاز الفعلية.

3 دقائق قراءةمصدر واحد

تقنية

أهمية التبديل: ماذا تخسر الدرجة عند خلط عمود؟

أهمية الخصائص بالتبديل تبدأ من مقارنة درجة أصلية بدرجة بعد تبديل عمود. [1] لتوضيح وحدة الحساب، نكتب أربعة صفوف ودالة تنبؤ معلنة، ثم تبديلين نختارهما يدويًا. لم ندرب مقدرًا أو نستدع المكتبة، ولن نسمي الفرق الذي حسبناه قوة سببية في العالم.

3 دقائق قراءةمصدران

تقنية

مصنف يمتنع عن بعض الحالات: أي مقام يحسب خطأ المقبول؟

الخطأ الانتقائي والتغطية يصفان جانبين مختلفين لمصنف يستطيع قبول حالات والامتناع عن غيرها. نسبة القبول لا تقول وحدها كم أخطأ فيما قبله. نكتب سجلًا من ثماني حالات، ونحسب المقامين، ثم نرى لماذا لا يعني رفض مزيد من الحالات أداء أفضل تلقائيًا.

3 دقائق قراءةمصدر واحد

تقنية

التنبؤ المطابق: هل تغطية 80 ٪ وعد لكل مدخل؟

التغطية الهامشية في التنبؤ المطابق لا تعني أن كل مدخل يملك وعدًا منفردًا بالنجاح. سنحسب مجموعة فئات من أربع درجات معايرة معلنة وفق وصف الورقة، ثم نفصل صحة هذا الحساب عن الشروط الاحتمالية التي لم نختبرها في بيانات حقيقية.

3 دقائق قراءةمصدر واحد

تقنية

التعلم النشط: هل يختار الهامش والإنتروبيا الحالة نفسها؟

عند مقارنة الهامش والإنتروبيا في التعلم النشط، اسأل أولًا عن العدد الذي ترتبه. قد تتقارب أعلى فئتين في حالة، بينما تتوزع كتلة الاحتمالات على فئات أكثر في أخرى. نكتب احتمالين ثلاثيين ونقرأ قرار طلب الوسم تحت معيارين، دون افتراض أن أي طلب منهما سيحسن نموذجًا.

3 دقائق قراءةمصدر واحد

تقنية

warm_start في SGD: هل حفظ الأوزان يحفظ عداد التعلم؟

سؤال warm_start وعداد التعلم في SGD يخص حالتين منفصلتين: من أين تبدأ الأوزان، وأي فهرس يدخل معدل التعلم؟ قد تعود البداية العددية نفسها مع اختلاف الفهرس. نقرأ عقد SGDClassifier، ثم نعزل هذا الفرق في تحديث واحد ذي تدرج مفترض، حتى لا نسمي حفظ المعاملات استئنافًا كاملًا لكل الحالة.

3 دقائق قراءةمصدر واحد

تقنية

الرموز في نماذج اللغة: لماذا لا تساوي الكلمات؟

الرموز في نماذج اللغة، أو التوكنات، وحدات يعالج بها النموذج النص. قد يكون الرمز كلمة أو جزءاً منها؛ لذلك لا يساوي عدد الرموز عدد الكلمات. تختلف طريقة التقسيم باختلاف أداة الترميز والمفردات التي تعتمد عليها. [1]

3 دقائق قراءةمصدران

تقنية

نافذة السياق: ما الذي يدخل ضمن حد النص؟

نافذة السياق هي مساحة المعلومات التي يستطيع النموذج الرجوع إليها أثناء إنشاء الرد، ويشمل مفهومها أيضاً الرد الذي ينتجه. وهي تختلف عن البيانات التي تدرب عليها النموذج؛ لذلك ليست أرشيفاً لكل معرفة سابقة أو لكل محادثة. [1]

3 دقائق قراءةمصدران