مع تقدم التقنيات المتعلقة بنماذج اللغة الصوتية، أصبح من الشائع استخدامها لتمثيل الكلام البشري من خلال رموز خاصة بدلاً من الاعتماد فقط على سلاسل تقنيات التعرف على الكلام (ASR) ونماذج اللغة الكبيرة (LLM) وأنظمة تحويل النص إلى كلام (TTS). تسهل هذه الرموز التفاعل السريع والمعبر، ولكنها قد تحتفظ أيضًا بخصائص حساسة تعود للمتحدث.
ناقتنا الخارجة عن الطيب: هل يمكن أن تكشف هذه الرموز عن بصمات الصوت؟
في البحث المبتكر “هل تكشف رموز الكلام بصمات الصوت؟ هجمات عكس الصوت ضد نماذج اللغة الصوتية الشاملة”، تم استكشاف هذه المسألة الحرجة.
يعرض الباحثون نموذجًا يُعرف باسم Audio BERT (AuB)، وهو نموذج قابل للتدريب يصنع تمثيلات رمزية من مجموعة رموز محددة. يزيد هذا النموذج من دقة التعرف على الخصائص الصوتية للمتحدثين.
ويتم تقديم طريقة جديدة تُسمى SpInv، والتي تمثل نوعًا متقدمًا من طرق عكس الصوت، تقوم على استعادة تمثيلات الصوت وفقًا لنموذج مُحدد مسبقًا للمتحدث.
قامت الدراسة بتقييم نماذج الصوت الشهيرة مثل Moshi، Higgs3، Kimi-Audio، وQwen3-Omni باستخدام بروتوكولات غير مرتبطة بالمتحدثين على مجموعة بيانات VoxCeleb.
أظهرت التجارب أن SpInv تتمكن من تحقيق توافق كبير في التقدير التشكيلي مع قيم تفوق 0.70 خلال ثلاث ثوانٍ فقط من الناتج الصوتي الأولي.
هذا البحث يسهم في النقاش الدائر حول توسيع نطاق استخدام نماذج اللغة الصوتية وتأثيراتها على الخصوصية، مما يثير العديد من الأسئلة حول الضوابط الأمنية اللازمة.