تقنية (الصفحة 44)

أفكار وأدوات رقمية بلغة مفهومة.

1201 مقال

تقنية

تمييز كلمات نتائج البحث: اللون لا يثبت اكتمال الدليل

تمييز كلمات نتائج البحث يجعل موضع المطابقة أوضح بصريا. تصف وثائق Azure AI Search تنسيق المصطلحات المطابقة، مع دعم محدود للتمييز في بعض الاستعلامات الموسعة مثل البحث التقريبي. [1] لا تعني الكلمة الملونة أن المقتطف يجيب عن سؤال القارئ أو يعرض جميع شروط الإعلان.

3 دقائق قراءةمصدر واحد

تقنية

وزن حقول البحث: عنوان بارز لا يجعل الفقرة جوابا

وزن حقول البحث يتيح تفضيل المطابقة في حقل على مطابقة مشابهة في حقل آخر. تصف وثائق Azure AI Search أوزانا موجبة تضرب مساهمة الحقل النصي القابل للبحث؛ هذه الملفات تطبق على حقول غير متجهية. [1] نفحص أثر ذلك في عنوان تعليمات، دون اختيار وزن مثالي أو تشغيل فهرس.

3 دقائق قراءةمصدر واحد

تقنية

النصوص المتشابهة دلاليا: مرشحان للمراجعة لا نسخة واحدة مؤكدة

النصوص المتشابهة دلاليا قد تظهر في قائمة أزواج تحتاج إلى قراءة. تشرح وثائق Sentence Transformers أن paraphrase_mining يعيد أزواج نصوص عالية التشابه، مع درجة ومعرفي النصين. [1] لا تثبت هذه القائمة وحدها أن إعلانين نسخة واحدة أو أن حذف أحدهما يحفظ كل معلومات الدليل.

3 دقائق قراءةمصدر واحد

تقنية

البحث عن الصور بالنص: كيف تصل إلى صورة موجودة؟

البحث عن الصور بالنص يسترجع صورا موجودة في مجموعة، بدلا من رسم صورة جديدة كل مرة. يشرح دليل Milvus مسارا يحول الصور والوصف النصي إلى تمثيلات مشتركة باستخدام CLIP، ثم يقارنها بالتشابه. [1] نوضح الفرق بمكتبة صور خيالية، دون تشغيل النموذج أو تعميم جودة العربية في نسخته.

3 دقائق قراءةمصدر واحد

تقنية

تصنيف الصور بأسماء جديدة: ماذا تقرر قائمة الفئات؟

تصنيف الصور بأسماء جديدة يسمح باختبار أوصاف لفئات دون تدريب إضافي خاص بالقائمة الجديدة، في نموذج يدعم المهمة. يصف Hugging Face نماذج تعلمت تمثيلات رؤية ولغة من صور وأوصاف، وتستقبل الصورة مع أسماء مرشحة. [1] نميز اختيار الأعلى ضمن قائمة من التحقق من ماهية الشيء الظاهر.

3 دقائق قراءةمصدر واحد

تقنية

الطابع الزمني في تفريغ الصوت: أين تبدأ المراجعة؟

الطابع الزمني في تفريغ الصوت يربط النص بموضع مقترح داخل التسجيل. توضح وثيقة Whisper في Hugging Face أن بيانات المقاطع قد تشمل بداية المقطع ونهايته، وتعرض خيارا مختلفا للطوابع على مستوى الرموز. [1] نوضح كيف تستخدم هذا الموضع للمراجعة دون جعله شهادة على توقيت كل كلمة أو هوية قائلها.

3 دقائق قراءةمصدر واحد

تقنية

أخذ عينات من إطارات الفيديو: ماذا حدث بين اللقطات؟

أخذ عينات من إطارات الفيديو يختار صورا من المقطع بدلا من عرض كل لحظة للمعالجة. يوضح دليل Hugging Face في فرع main أن نماذج الفيديو والنص قد تستقبل إطارات مختارة، وأن مهمة الدليل لا تتعامل مع الصوت. [1] نوضح حدود الاستنتاج من ثلاث لقطات افتراضية دون تحليل فيديو حقيقي.

3 دقائق قراءةمصدر واحد

تقنية

إدخال الصورة مع السؤال: هل وصل المحتوى المرئي فعلا؟

إدخال الصورة مع السؤال يختلف عن كتابة اسم ملف في محادثة نصية. يشرح Hugging Face نماذج رؤية ولغة تستقبل صورة ونصا مفتوحا، ويعرض إعدادا يمرر محتوى الصورة والسؤال للمعالجة. [1] نوضح الفرق في مدخل المهمة قبل الحكم على الجواب، دون افتراض أن كل واجهة تستقبل الصور أو تفهمها بدقة.

3 دقائق قراءةمصدر واحد

تقنية

وصف الصورة وسؤال عنها: هل تحتاج المشهد أم تفصيلا؟

وصف الصورة وسؤال عنها مهمتان متقاربتان في المدخل المرئي، لكنهما لا يطلبان النتيجة نفسها. يعرف Hugging Face وصف الصورة بأنه توقع عبارة تصفها، [1] ويعرف السؤال البصري بأنه جواب يعتمد على الصورة والسؤال. [2] نستخدم مشهدا توضيحيا مولدا لفحص هذا الفرق، دون تجربة نموذج أو إعلان دقته.

3 دقائق قراءةمصدران

تقنية

الصورة وبياناتها الوصفية: من أين جاء التاريخ والمكان؟

الصورة وبياناتها الوصفية قد تقدمان نوعين مختلفين من المعلومات. توثق ExifTool حقل DateTimeOriginal لوقت الصورة الأصلية، [1] وتوثق حقول GPS وكتابتها في الملف. [2] نميز قراءة قيمة مسجلة عن استنتاج مكان أو تاريخ من المشهد، دون فحص ملف مستخدم أو إعلان صحة بياناته.

3 دقائق قراءة3 مصادر

تقنية

دعم العربية في OCR: هل يشمل المطبوع وخط اليد؟

دعم العربية في OCR يحتاج إلى تحديد المهمة ونمط الكتابة. تعرض Microsoft جدولا للمطبوع وآخر لخط اليد في أحدث نموذج Read GA الذي تصفه الصفحة؛ العربية واردة في جدول المطبوع، ولا تظهر في جدول خط اليد المذكور. [1] هذا نطاق مصدر محدد، لا حكم على كل أدوات القراءة أو على استحالة قراءة العربية اليدوية.

3 دقائق قراءةمصدر واحد

تقنية

تحليل صفحة ممسوحة: هل العنوان جزء من الخطوة؟

تحليل صفحة ممسوحة قد يعيد النص مع معلومات عن بنية الصفحة. يوضح دليل Document Intelligence v4.0 أن النموذج يتوقع أدوارا لبعض الكتل، مثل عنوان وعنوان قسم وتذييل. [1] نراجع دورا متوقعا وترتيبا مفترضا في صفحة ورشة، دون تحليل ملف أو ضمان صحة التصنيف.

3 دقائق قراءةمصدر واحد

تقنية

قراءة جدول من صورة: إلى أي عمود ينتمي الرقم؟

قراءة جدول من صورة تتطلب أكثر من استخراج أرقام متتابعة. يشرح دليل Amazon Textract مواضع الخلايا بالصف والعمود، ويميز الخلايا العادية من كتلة خلية مدمجة تمتد عبر مواضع متعددة. [1] نستخدم هذا التمييز لمراجعة جدول افتراضي، دون إرسال صورة أو افتراض دعم الخدمة لنصه العربي.

3 دقائق قراءةمصدر واحد

تقنية

قراءة رسم بياني بالصورة: هل ارتفاع العلامة هو القيمة؟

قراءة رسم بياني بالصورة تحتاج إلى نقل بياناته قبل الاستدلال عليها. يشرح توثيق DePlot في Hugging Face مسارا يحول صورة الرسم إلى جدول نصي ثم يستعمله في الاستدلال. [1] نراجع هذه المرحلة بمثال يدوي، دون تشغيل النموذج أو نقل نسبة أداء من الدراسة إلى صور عربية.

3 دقائق قراءةمصدر واحد

تقنية

قراءة مخطط تدفق بالذكاء الاصطناعي: إلى أين يشير السهم؟

قراءة مخطط تدفق بالذكاء الاصطناعي تتطلب حفظ العلاقات، لا أسماء الصناديق فقط. توثق Graphviz إعدادا يحدد الطرف الذي يرسم عنده رأس السهم. [1] نستخدم هذه الفكرة البصرية في مخطط تعليمي نحدد معناه بأنفسنا؛ لا نساوي زخرفة السهم في البرنامج بتغيير علاقة منطقية في كل رسم.

3 دقائق قراءةمصدر واحد

تقنية

اقتصاص صورة للمساعد الذكي: ماذا خرج من الإطار؟

اقتصاص صورة للمساعد الذكي يغير الجزء المتاح للمراجعة. يصف توثيق Pillow الاقتصاص بأنه أخذ منطقة مستطيلة تحدد حدودها في الصورة. [1] نناقش أثر اختيار هذه المنطقة على سؤال القارئ، دون تعديل صورة فعلية أو تجربة نموذج؛ وضوح سطر مقرب لا يعوض شروطا خرجت من الإطار.

3 دقائق قراءةمصدر واحد

تقنية

تصغير الصورة وتكبيرها للمساعد الذكي: هل عادت التفاصيل؟

تصغير الصورة وتكبيرها قد يغير ما يصل إلى مساعد بصري. يصف توثيق Pillow تغيير الحجم بأبعاد مطلوبة، ويشرح مرشحات لإعادة أخذ العينات. [1][2] نستخدم الحساب اليدوي لتوضيح ما لا تثبته الأبعاد وحدها؛ لا نعالج صورة أو نجرب أداة تحسين، ولا نحكم على أداء كل وسائل التكبير.

3 دقائق قراءةمصدران