لا تستنتج مدة ملف الكلام المولد من رقم السرعة وحده. اعرف معنى الإعداد في الخدمة، وما أجزاء المقطع التي تتغير، ثم قس المخرج الفعلي. قد تتضمن الخطة كلاما ووقفات، فلا يصح افتراض أن كل أجزاء المقطع تتقلص بالنسبة نفسها. كذلك يختلف طلب توليد نسخة جديدة عن الاستماع إلى نسخة موجودة عبر إعداد تشغيل مختلف.
الخلاصة السريعة
الإعداد يحدد سرعة مطلوبة وفق الخدمة؛ مدة الملف نتيجة تحتاج إلى قياس مع الوقفات والمحتوى الفعليين.
- تعريف سرعة التوليد مرتبط بالصوت والخدمة؛ توثيق AudioConfig في Google يجعل 1 السرعة الطبيعية للصوت و2 ضعفها، ضمن 0.25 إلى 2. [1]
- احسب الكلام والوقفات وفق الافتراضات المعلنة؛ مثال كلام 8 ثوان ووقفة ثابتة 2 ثانية لا يصير كله 5 ثوان إذا تغير الكلام وحده إلى النصف.
- افصل إعداد التوليد عن إعداد مشغل لا يعيد كتابة الملف؛ تغيير طريقة الاستماع لا يثبت إنشاء نسخة جديدة.
- تحقق من اكتمال الكلام ومواضع الوقفات ومدة الناتج؛ لا تجعل الملاءمة الزمنية بديلا عن مراجعة المعنى.
اقرأ معنى قيمة السرعة
يحدد توثيق AudioConfig لخدمة Google مجال speakingRate من 0.25 إلى 2، ويصف 1 بأنه السرعة الطبيعية للصوت المحدد، و2 بأنه ضعف السرعة. هذا تعريف لإعداد الخدمة، وليس قياسا أجريناه لملف عربي. [1]
ابدأ بنص وصوت معلومين، ثم سجل القيمة التي طلبتها. لا تقارن قيمتين من خدمتين مختلفتين كأن مرجعهما واحد، ولا تنسب العدد إلى سرعة بشرية ثابتة بالكلمات في الدقيقة دون دليل يبين هذه العلاقة. الصوت الطبيعي المقصود في التعريف هو صوت الخدمة المختار.
حدد ما الذي تغير في الحساب
نضع مثالا حسابيا مستقلا، دون تشغيل مولد: جزء الكلام 8 ثوان، وتليه وقفة ثابتة مقدارها ثانيتان. المجموع الأصلي 10 ثوان. نفترض في هذه المقارنة فقط أن زمن الكلام ينخفض إلى نصفه، بينما تبقى الوقفة ثابتة. تصبح النتيجة 4 زائد 2، أي 6 ثوان.
قسمة المجموع الأصلي على اثنين تعطي 5 ثوان، لكنها تفترض أن الوقفة تقلصت أيضا. وهذا ليس افتراض مثالنا. لا ننسب نتيجة الست ثوان إلى Google أو إلى كل واجهة سرعة؛ المقصود بيان ضرورة معرفة حدود التغيير قبل إجراء الحساب.
التشغيل لا يساوي إنشاء نسخة
في سيناريو آخر، لدينا ملف محفوظ ومشغل يغير سرعة الاستماع فقط ولا يكتب بيانات جديدة. إذا عدل المستمع إعداد هذا المشغل، فلا نكتب أن خدمة التوليد أنشأت ملفا جديدا. الملف المحفوظ بقي نفسه وفق شروط السيناريو.
أما إذا طلبنا توليد نسخة جديدة بإعداد سرعة آخر، فاحتفظ بالنسخة الناتجة وسجل إعدادها. وإذا استخدمنا أداة لتصدير صوت معدل، فذلك إجراء مستقل يجب وصفه بنتيجته. بهذه الطريقة لا نخلط مدة الاستماع الحالية بخصائص ملف لم نفحصه أو نعدله.
الزمن المناسب ليس الفحص الوحيد
افترض أن الإعلان يجب أن ينتهي قبل علامة انتقال في عرض. عند توفر صوت فعلي، قس مدته وتحقق من اكتمال الجملة وموضع الوقفات. قد تصبح نسخة أقصر بسبب كلمة محذوفة، وهذا لا يحقق طلب قراءة النص كاملا.
راجع الأسماء والأعداد والنفي، ثم سجل أي تعديل ومخرجه. إذا لم ننشئ الصوت، فالموجود إعداد مقترح وحساب افتراضي، ولا نقول إن المقطع صار ملائما للعرض. ولا نعلن أن زيادة السرعة حسنت الفهم أو الجودة من دون تجربة ودليل مناسبين.
المصادر ومتابعة القراءة
- Google Cloud Text-to-Speech AudioConfig (يفتح في نافذة جديدة)docs.cloud.google.com
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
