تقنية

تعديل حركة الشفاه: هل التوافق مع الصوت يثبت الكلام الأصلي؟

رسم يربط وجها صامتا وصوتا منفصلا بناتج تعديل مفترض مع فصل دعوى الكلام الأصلي.
رسم تحريري من إعداد بحر العلوم؛ لا يمثل فيديو عدلناه أو شخصا حقيقيا.

مزامنة الشفاه ومصدر الكلام سؤالان مختلفان عند تحليل فيديو أو تعديله بمساعدة الذكاء الاصطناعي. صورة تبدو متوافقة مع عبارة قد تكون ناتجا مشروطا بصوت أضيف لاحقا. نقرأ مدخلات Wav2Lip ثم نؤلف بطاقة عمل تفصل مسار الصورة عن مسار الصوت، دون تعديل وجه أو اختبار كشف تلاعب.

الخلاصة السريعة

التوافق الظاهر مع صوت مدخل لا يثبت أن الشخص نطق العبارة في التسجيل الأصلي؛ احفظ مصدر كل مدخل وما تمت مراجعته فعلا.

  • يعرض مستودع Wav2Lip مدخل فيديو للوجه ومدخل صوت لتوليد مزامنة الشفاه. [1] وظيفة هذا المسار ليست استرجاع كلام أصلي مجهول.
  • في بطاقتنا فيديو وجه صامت وعبارة صوتية منفصلة؛ إذا وافق الناتج العبارة فلا تصبح بذلك كلاما نطق في أصل الفيديو.
  • إذا حجب الفم في جزء، يبقى التوافق البصري فيه غير قابل للمراجعة من المشاهدات المتاحة؛ لا يملأ صوت واضح هذا الحجب.
  • احتفظ بمصادر الصورة والصوت وتاريخ المعالجة ودليل أي فحص؛ لا نحكم على هوية متكلم أو صدق واقعة من اسم أداة، ولم نعدل فيديو.

ما المدخل الذي يوجه الحركة؟

يوثق مستودع Wav2Lip الرسمي إدخال فيديو للوجه عبر face وصوت عبر audio في مسار الاستدلال. ويمكن أن يكون مصدر الصوت ملفا صوتيا أو فيديو تستخرج منه البيانات الصوتية. [1]

هذا وصف لدور مدخلين في المهمة، لا نتيجة فحص ملف عندنا. حين نعرف أن الصوت مدخل مستقل، لا ننتظر من تعديل الصورة أن يخبرنا أي عبارة كانت مسجلة مع الوجه قبل المعالجة.

ولا نساوي هذا المسار بنقل الكلام إلى لغة أخرى أو بإثبات هوية صاحب الصوت. قد تصاحب الصورة عبارة معروفة في المدخل، بينما تظل علاقتها بالتسجيل السابق سؤالا يحتاج مادة تخصه.

كيف تنشأ نسبة غير صحيحة إلى الأصل؟

نؤلف بطاقة تسمي م 1 فيديو وجه صامت، وم 2 صوت عبارة «ضع البطاقة قرب النافذة». نفترض ناتجا م 3 عدلت فيه حركة الفم لتوافق م 2. هذه حالة تعليمية معلنة؛ لم ننتج أيا من الملفات.

يمكن كتابة «استعمل المثال صوت م 2 لتوجيه تعديل م 1». أما «كشفنا أن الشخص قال العبارة في م 1» فيضيف كلاما غير موجود في أصلنا الصامت. جودة التوافق المفترضة لا تعيد كتابة تاريخ ذلك المدخل.

حتى لو لم يكن الأصل صامتا في حالة أخرى، لا نستبدل صوته بالصوت الجديد ثم ننسب الجديد إلى الأصل بلا مقارنة موثقة. ينبغي أن يبقى دور النسخة المعالجة ظاهرا في الوصف.

ماذا يترك الفم المحجوب مجهولا؟

نضيف إلى التمرين فترة تغطي فيها بطاقة فم الوجه. الصوت المضاف مفهوم، لكن صورة الفم غير متاحة في تلك الفترة. لا نصف حركته بأنها راجعت ووافقت الكلمات ما دمنا لا نرى الجزء المطلوب.

ولا يثبت هذا الحجب أن الحركة مخالفة أيضا؛ يبقى سؤال التوافق البصري هناك غير محسوم. قد نستطيع مراجعة أجزاء أخرى مكشوفة، فنحدد نطاقها دون تعميمها على كل الإطارات.

المقال لا يقدم علامة لاكتشاف فيديو مزيف أو حكما على شخص حقيقي. التفريق بين غير مرئي وبين مرئي لا يساوي قرارا عن منشأ كل ملف.

أي وصف يحافظ على مصادر العمل؟

نقترح سجلا يذكر نسخة الوجه ومصدر الصوت والعلاقة المعلنة بينهما ووجود معالجة وما فحص فعلا. إذا كان المطلوب توثيق عبارة أصلية، نطلب دليلا يخص التسجيل الأصلي والصوت المصاحب له، لا اسما تقنيا للناتج وحده.

يمكن للمساعد ترتيب هذه المعلومات وصياغة نطاق الادعاء. لكن بطاقة مدخلات لا تثبت أن المعالجة شغلت أو نجحت؛ نميز الوصف المقترح عن ناتج تمت معاينته.

لم نشغل Wav2Lip أو نولد صوتا أو نراجع موافقة شخص. مثالنا يشرح كيف يتغير استنتاج المنشأ عندما يكون الصوت شرطا لتعديل الصورة، مع إبقاء الفترات المحجوبة خارج حكم المطابقة.

المصادر ومتابعة القراءة

  1. Wav2Lip official repository: inference inputs (يفتح في نافذة جديدة)github.com

أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.