الفصل بين المتحدثين قد ينتج تسميات مثل «المتحدث أ» و«المتحدث ب». لا تتحول هذه الرموز إلى أسماء أشخاص بمجرد ظهورها بجوار النص. في تمرين مكتوب عن ترتيب معرض أوراق نميز التجميع المقترح للأصوات من ربطها بأشخاص معروفين؛ لم نستمع إلى ملف أو نشغل نظام فصل.
الخلاصة السريعة
تسمية المتحدث تشير إلى إسناد صوتي مقترح داخل المخرج؛ إثبات اسم الشخص يحتاج معلومة مستقلة موثوقة.
- تصف وثيقة Google إسناد أرقام إلى أصوات يميزها النظام في العينة؛ الصفحة تعرض الميزة بوصفها تجريبية، ويجب التحقق من دعم اللغة. [1]
- في مثالنا تعود عبارتان إلى التسمية أ؛ وجود سلمى وطارق في قائمة الحضور لا يبين أيهما صاحب هذه التسمية.
- افصل مراجعة إسناد المقاطع من مراجعة الأسماء؛ عبارة «أنا طارق» معلومة داخل الكلام تحتاج تقدير سياقها، ولا تجعل التسمية نفسها إثباتا للهوية.
- احتفظ بالتسمية الأصلية ودليل الربط وحالته؛ لا تنقل ارتباط أ باسم في ملف إلى ملف آخر دون تحقق جديد، ولا تستنتج الموافقة على مهمة من مجرد الكلام.
ماذا يقترح النظام عند فصل الأصوات؟
تشرح Google أن الفصل يكتشف تغير المتحدث ويضع رقما للكلمات المنسوبة إلى كل صوت؛ الكلمات المسندة إلى الصوت نفسه تحمل الرقم نفسه. وتعرض الصفحة الميزة في مرحلة تجريبية، وتحيل إلى دعم اللغات. [1]
لهذا نبدأ بقراءة مخرج بعينه كما هو، ونكتب «التسمية أ» بدلا من اختراع اسم. رقمها وسيلة لتمييز مجموعة مقاطع مقترحة في هذا المخرج؛ المراجعة لم تتم لمجرد أن السطور تبدو مرتبة. لا نعطي هنا نسبة دقة أو وعدا بتمييز كل الأصوات العربية.
هل تكفي قائمة الحضور لمعرفة الاسم؟
نفترض أن ورقة حضور المعرض تحتوي اسمي سلمى وطارق. وفي مسودة مفترضة يقول أ «أعددت بطاقات الرف»، ثم يظهر أ مرة أخرى بجملة «بقيت بطاقتان». لم نحدد أي صوت يخص أي اسم. يمكن أن تنسب المسودة الجملتين إلى المجموعة نفسها، بينما يظل الاسم مجهولا.
تبديل أ إلى سلمى لأن اسمها أول القائمة يضيف معلومة لا تقدمها القائمة. وحتى لو اعتقد المراجع أنه يعرف صاحب الصوت، يلزمه بيان أساس الربط وحدوده، ومراجعة المقطع الذي نسب إليه قبل اعتماد الجملة على أنها قول شخص محدد.
أي دليل راجعت: الصوت أم الاسم؟
في سجل المراجعة المقترح لدينا خانتان: هل يوافق إسناد المقطع ما نراجعه في التسجيل، وما دليل الاسم؟ قد تتحسن مراجعة الأولى بينما تظل الثانية غير محسومة. كذلك قد نعرف اسم المتحدث في افتتاح التسجيل، لكن لا يثبت ذلك أن كل مقطع لاحق مسند إليه صحيح.
إن ظهرت عبارة «أنا طارق» نحتفظ بها مع موضعها وسياقها. قد تكون تقديم الشخص نفسه أو اقتباس كلام آخر؛ لا تحسم قراءة العبارة وحدها هذا الفرق. ولا نعد صوتين متشابهين دليلا كافيا على أنهما شخص واحد.
كيف تحفظ النتيجة دون زيادة معناها؟
نكتب مثلا «التسمية أ: الاسم غير محسوم»، ونضيف أي ربط راجعناه بدلا من محو أثر المسودة الأولى. إذا ورد اسم لاحقا نسجل المعلومة التي غيرت الحالة، ونراجع المقاطع المتأثرة؛ لا نعمم الربط آليا على تسجيل جديد يستخدم الرمز أ أيضا.
والقول «أعددت بطاقات الرف» لا يثبت وحده أن المتحدث وافق على ترتيب المعرض كله. فصل الأصوات وربط الاسم وفهم نطاق الالتزام أسئلة مختلفة في تمريننا. هذه طريقة لحفظ حدود الاستنتاج، وليست نتيجة اختبار هوية أو اجتماع حقيقي.
المصادر ومتابعة القراءة
- Google Cloud: Detect different speakers in an audio recording (يفتح في نافذة جديدة)docs.cloud.google.com
أُعدّ هذا المقال بصياغة عربية أصلية بالاستناد إلى المصادر أعلاه، وهو مدخل تمهيدي إلى الموضوع. اقرأ منهجية المحتوى وحدوده.
