الطابع الزمني في تفريغ الصوت يربط النص بموضع مقترح داخل التسجيل. توضح وثيقة Whisper في Hugging Face أن بيانات المقاطع قد تشمل بداية المقطع ونهايته، وتعرض خيارا مختلفا للطوابع على مستوى الرموز. [1] نوضح كيف تستخدم هذا الموضع للمراجعة دون جعله شهادة على توقيت كل كلمة أو هوية قائلها.
الخلاصة السريعة
عامل زمن المقطع كنقطة للعودة إلى الصوت الأصلي؛ اسمع العبارة في التسجيل نفسه قبل اعتماد نصها أو وقتها أو نسبتها لشخص.
- في المخرج الموصوف، بداية المقطع ونهايته تخصان المقطع؛ لا تعني البداية أن كل كلمة فيه قيلت عند تلك الثانية. [1]
- في مثالنا تقع العبارة داخل مقطع من الثانية 30 إلى 40؛ بدء الاستماع عند 30 يساعد على مراجعتها، ولا يحدد لحظة كلمة «طرفه».
- قارن النص بالصوت واللغة المقصودة؛ نراجع التفريغ الأصلي في المثال، ولا نعرض ترجمة بوصفها الألفاظ المنطوقة نفسها.
- ثبت نسخة الملف وبداية حساب الزمن؛ الطابع وحده لا يثبت اسم المتحدث أو ساعة الحدث، والمقطع المقصوص يحتاج بيان علاقته بالأصل.
إلى ماذا يشير زمن المقطع؟
نفترض تسجيلا تعليميا مدته دقيقتان لصناعة غلاف دفتر. في تفريغ افتراضي، يظهر مقطع من الثانية 30 إلى الثانية 40، ونصه «نضع الغلاف على الطاولة ونفحص طرفه». لم نسجل صوتا أو نشغل التفريغ؛ وضعنا هذه البيانات لنوضح كيفية قراءة موضع مراجعة.
تعرف الوثيقة بداية ونهاية مقطع ناتج، وتفرق إعداد الطوابع على مستوى الرموز عن إرجاع المقاطع. [1] لذلك لا ننقل رقم البداية تلقائيا إلى كل كلمة. عبارة متعددة الكلمات قد تحتاج العودة إلى الصوت لمعرفة أين يقع الجزء الذي نريد التحقق منه.
كيف تبحث عن كلمة دون اختراع لحظتها؟
يريد محرر الدليل مراجعة كلمة «طرفه». يستطيع البدء من الثانية 30 في الملف المعني والاستماع إلى المقطع، ثم مقارنة الجملة بما سمعه. لا يكتب في الهامش «قيلت طرفه عند 30 تماما» لأن البيانات التي افترضناها تحدد مقطعا، لا موضع تلك الكلمة منفردة.
ولو احتاج زمن كلمة بعينها، يطلب مخرجا يناسب ذلك الغرض ثم يتحقق منه بالصوت. لا نفترض أن تبديل الخيار يمنح توقيتا صحيحا دائما أو أن القيم الموجودة في ملف آخر تقاس من البداية نفسها. المهم تحديد ما تشير إليه القيمة فعلا قبل استخدامها.
هل نقل النص ما تريد مراجعته؟
قد يتضمن التفريغ خطأ في لفظ أداة أو نفي قصير. نقترح إبقاء التسجيل مرجعا للمحرر، والاستماع إلى العبارة وما يحيط بها حتى لا يقتطع أمرا من سياقه. العثور على الكلمة في النص لا يثبت وحده أن التفريغ نقلها سليما.
هدف مثالنا مراجعة الألفاظ المنطوقة بلغتها، لا ترجمتها. لو قدمت واجهة ترجمة، لا نسمي جملتها النص الأصلي الذي قاله المتحدث. ولا تنشئ قراءة الزمن دليلا على اسم القائل؛ نحتاج ما يثبت النسبة في التسجيل أو معلوماته الموثوقة، خصوصا إذا تشابهت الأصوات.
أي تسجيل وأي بداية للزمن؟
نفترض أن المحرر قص أول عشرين ثانية من نسخة للمراجعة. الموضع 30 في النسخة المقصوصة لا يشير إلى الموضع 30 في الأصل؛ ومع افتراض القص وحده دون تغييرات أخرى، يقابله 50 في الأصل. نوضح هذا الحساب يدويا، ولا نزعم اكتشاف تعديل ملف حقيقي.
نقترح حفظ اسم النسخة وعلاقتها بالأصل مع الملاحظة. والثواني داخل الملف لا تتحول إلى ساعة وقوع حدث في العالم دون معلومة مستقلة عن بدء التسجيل وعلاقته بالحدث. يوفر الزمن بابا للاستماع والتحقق؛ لا يعوض الصوت أو يثبت دقة التفريغ في نموذج أو لغة لم نجربهما.
المصادر ومتابعة القراءة
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
