جميع المقالات (الصفحة 104)

قراءات عربية في العلوم والتقنية والطبيعة والثقافة، تبدأ بسؤال وتترك لك مساحة للاستكشاف.

2302 مقال

تقنية

الصورة وبياناتها الوصفية: من أين جاء التاريخ والمكان؟

الصورة وبياناتها الوصفية قد تقدمان نوعين مختلفين من المعلومات. توثق ExifTool حقل DateTimeOriginal لوقت الصورة الأصلية، [1] وتوثق حقول GPS وكتابتها في الملف. [2] نميز قراءة قيمة مسجلة عن استنتاج مكان أو تاريخ من المشهد، دون فحص ملف مستخدم أو إعلان صحة بياناته.

3 دقائق قراءة3 مصادر

تقنية

دعم العربية في OCR: هل يشمل المطبوع وخط اليد؟

دعم العربية في OCR يحتاج إلى تحديد المهمة ونمط الكتابة. تعرض Microsoft جدولا للمطبوع وآخر لخط اليد في أحدث نموذج Read GA الذي تصفه الصفحة؛ العربية واردة في جدول المطبوع، ولا تظهر في جدول خط اليد المذكور. [1] هذا نطاق مصدر محدد، لا حكم على كل أدوات القراءة أو على استحالة قراءة العربية اليدوية.

3 دقائق قراءةمصدر واحد

تقنية

تحليل صفحة ممسوحة: هل العنوان جزء من الخطوة؟

تحليل صفحة ممسوحة قد يعيد النص مع معلومات عن بنية الصفحة. يوضح دليل Document Intelligence v4.0 أن النموذج يتوقع أدوارا لبعض الكتل، مثل عنوان وعنوان قسم وتذييل. [1] نراجع دورا متوقعا وترتيبا مفترضا في صفحة ورشة، دون تحليل ملف أو ضمان صحة التصنيف.

3 دقائق قراءةمصدر واحد

تقنية

قراءة جدول من صورة: إلى أي عمود ينتمي الرقم؟

قراءة جدول من صورة تتطلب أكثر من استخراج أرقام متتابعة. يشرح دليل Amazon Textract مواضع الخلايا بالصف والعمود، ويميز الخلايا العادية من كتلة خلية مدمجة تمتد عبر مواضع متعددة. [1] نستخدم هذا التمييز لمراجعة جدول افتراضي، دون إرسال صورة أو افتراض دعم الخدمة لنصه العربي.

3 دقائق قراءةمصدر واحد

تقنية

قراءة رسم بياني بالصورة: هل ارتفاع العلامة هو القيمة؟

قراءة رسم بياني بالصورة تحتاج إلى نقل بياناته قبل الاستدلال عليها. يشرح توثيق DePlot في Hugging Face مسارا يحول صورة الرسم إلى جدول نصي ثم يستعمله في الاستدلال. [1] نراجع هذه المرحلة بمثال يدوي، دون تشغيل النموذج أو نقل نسبة أداء من الدراسة إلى صور عربية.

3 دقائق قراءةمصدر واحد

تقنية

قراءة مخطط تدفق بالذكاء الاصطناعي: إلى أين يشير السهم؟

قراءة مخطط تدفق بالذكاء الاصطناعي تتطلب حفظ العلاقات، لا أسماء الصناديق فقط. توثق Graphviz إعدادا يحدد الطرف الذي يرسم عنده رأس السهم. [1] نستخدم هذه الفكرة البصرية في مخطط تعليمي نحدد معناه بأنفسنا؛ لا نساوي زخرفة السهم في البرنامج بتغيير علاقة منطقية في كل رسم.

3 دقائق قراءةمصدر واحد

تقنية

اقتصاص صورة للمساعد الذكي: ماذا خرج من الإطار؟

اقتصاص صورة للمساعد الذكي يغير الجزء المتاح للمراجعة. يصف توثيق Pillow الاقتصاص بأنه أخذ منطقة مستطيلة تحدد حدودها في الصورة. [1] نناقش أثر اختيار هذه المنطقة على سؤال القارئ، دون تعديل صورة فعلية أو تجربة نموذج؛ وضوح سطر مقرب لا يعوض شروطا خرجت من الإطار.

3 دقائق قراءةمصدر واحد

تقنية

تصغير الصورة وتكبيرها للمساعد الذكي: هل عادت التفاصيل؟

تصغير الصورة وتكبيرها قد يغير ما يصل إلى مساعد بصري. يصف توثيق Pillow تغيير الحجم بأبعاد مطلوبة، ويشرح مرشحات لإعادة أخذ العينات. [1][2] نستخدم الحساب اليدوي لتوضيح ما لا تثبته الأبعاد وحدها؛ لا نعالج صورة أو نجرب أداة تحسين، ولا نحكم على أداء كل وسائل التكبير.

3 دقائق قراءةمصدران

تقنية

صور متعددة للمساعد الذكي: إلى أي صورة يعود الوصف؟

صور متعددة للمساعد الذكي تحتاج إلى علاقة واضحة بين السؤال وكل صورة. يشرح توثيق Hugging Face للمحادثات متعددة الوسائط محتوى منظما يضم عناصر نص وصورة، ومعالجا يعد المدخلات. [1] نناقش حفظ هذه العلاقة في أداة تدعم عدة صور فعلا، دون افتراض أن كل نموذج يقبلها أو يضمن جوابا منفصلا صحيحا.

3 دقائق قراءةمصدر واحد

تقنية

مقارنة صورتين بالذكاء الاصطناعي: هل تغير الشيء أم الصورة؟

مقارنة صورتين بالذكاء الاصطناعي تبدأ بتحديد نوع الفرق الذي تريد معرفته. توثق Pillow عملية تحسب القيمة المطلقة لفارق البكسلات بين صورتين. [1] هذا مخرج عددي عن الصور؛ نستخدمه لتمييز سؤال عن اختلاف الملفين من سؤال عن تغير شيء مصور، دون تشغيل مقارنة أو نموذج.

3 دقائق قراءةمصدر واحد

تقنية

قراءة رموز الخريطة بالمساعد الذكي: أي مفتاح يفسرها؟

قراءة رموز الخريطة بالمساعد الذكي تحتاج إلى مفتاح يخص الرسم المعروض. يعرض مورد USGS التعليمي الرموز والخطوط والمساحات ومفتاح معانيها ضمن قراءة الخرائط الطبوغرافية. [1] نستخدم هذه الفكرة في رسم افتراضي لناد فني، دون نقل رموز هذا النادي بوصفها اصطلاحات عالمية أو تجربة قراءة آلية.

3 دقائق قراءةمصدر واحد

تقنية

الصندوق المحيط في الصورة: هل الإحداثيات نسب أم بكسلات؟

الصندوق المحيط في الصورة يحدد منطقة، لكن قراءة أرقامه تحتاج إلى تعريف التمثيل. يوثق Amazon Textract موضعا من أعلى اليسار وأبعادا كنسب من أبعاد الصفحة. [1] نوضح هذا التمثيل بحساب افتراضي؛ لا نعممه على كل نموذج رؤية، ولا نعد صندوقا حول النص إثباتا أن النص قرئ سليما.

3 دقائق قراءةمصدر واحد

تقنية

عد العناصر المتداخلة بالصورة: هل الجزء الظاهر شيء مستقل؟

عد العناصر المتداخلة بالصورة يبدأ بتحديد ما يعد عنصرا مستقلا. يصف Hugging Face كشف الأجسام بمخرجات مواضع وتسميات للعناصر المكتشفة، ويذكر العد ضمن استخداماته. [1] لكن تحويل المخرجات إلى عدد كامل يحتاج إلى مراجعة علاقة المناطق بالأشياء؛ نوضح ذلك بتصور ورقي، دون تجربة كاشف أو عد مخزون فعلي.

3 دقائق قراءةمصدران

تقنية

النص المحجوب في الصورة: هل تكمل الرقم أم تحفظ النقص؟

النص المحجوب في الصورة يحتاج إلى فصل القراءة عن الإكمال. يصف Hugging Face نموذج TrOCR بفهم الصورة وتوليد النص، ويعرض تحويل المدخل المرئي إلى نص مولد. [1] لا يجعل وجود مخرج نصي حرفا غطاه الملصق مقروءا؛ نوضح هذا الفرق برمز وثيقة افتراضية، دون تجربة OCR أو افتراض دعمه لهذا النص العربي.

3 دقائق قراءةمصدر واحد

تقنية

قراءة المعادلات من صورة: هل الرقم أس أم معامل؟

قراءة المعادلات من صورة تسبق إجراء الحساب على الرموز المنقولة. توثق Microsoft استخراج صيغ رياضية بتمثيل LaTeX ومواضعها على الصفحة. [1] نستخدم الفصل بين الصورة والتمثيل والحل في مثال يدوي؛ لا نشغل الخدمة أو ننسب إلى صوره العربية دقة لم نقسها.

3 دقائق قراءةمصدر واحد

تقنية

كشف توقيع في مستند: هل عرفت العلامة أم صاحبها؟

كشف توقيع في مستند يجيب أولا عن موضع علامة، لا عن كل ما يتعلق بصاحبها. توثق AWS إرجاع مواضع توقيعات بصناديق محيطة ودرجة ثقة بوجود توقيع هناك. [1] نستخدم هذا المخرج لتوضيح أسئلة مختلفة في ورقة افتراضية؛ لا نتحقق من هوية أو توقيع حقيقي ولا نقرر حجية قانونية.

3 دقائق قراءةمصدر واحد

تقنية

قراءة لقطة شاشة بالمساعد الذكي: هل الزر متاح الآن؟

قراءة لقطة شاشة بالمساعد الذكي تساعد على وصف واجهة ظهرت في صورة. يعرض توثيق Playwright التقاط صورة للصفحة أو عنصر منها وحفظها أو إرجاع بياناتها. [1] نميز هذا المخرج المرئي من حالة برنامج يجري استخدامه الآن؛ لا نلتقط واجهة فعلية أو ننفذ زر حفظ في المثال.

3 دقائق قراءةمصدر واحد