تعتبر فيديوهات الديب فيك (Deepfake) الصوتية من التحديات المتزايدة في عالم التكنولوجيا، حيث تمكنت هذه الفيديوهات من تقليد الأصوات بشكل مذهل مما يصعب التعرف على الحقيقة. في الآونة الأخيرة، بدأت تقنيات الكشف عن الديب فيك الصوتية (Speech Deepfake Detection) في تحقيق تقدم ملحوظ، لكن الاداء في الظروف الحقيقية لا يزال يشكل تحديًا كبيرًا.

تعاني أنظمة الكشف من مشاكل تتعلق باللاسِتقرار بسبب الضوضاء المتداخلة والتشويش الناتج عن معالجة الصوت المختلفة. لذا، قدم الباحثون إطار عمل مبتكر تحت اسم 'تعلم التوافق الزمني والترددي' (Time-Frequency Consistency Learning - TFCL) لمواجهة هذه التحديات.

تقوم تقنية TFCL بمحاكاة خط معالجة الصوت بالكامل والذي يشمل تقنيات مثل إلغاء الصدى (Acoustic Echo Cancellation)، وتقليل الضوضاء (Noise Suppression)، والتحكم في الكسب التلقائي (Automatic Gain Control)، واكتشاف نشاط الصوت (Voice Activity Detection - VAD). وقد أظهرت النتائج أن التداخلات غير الخطية التي تنتجها عمليات المعالجة هذه تقلل بشكل كبير من أداء الكشف.

بهذا، قامت TFCL بتطوير آلية توازن مدفوعة بالانتباه لتلافي الانزلاقات الزمنية، بينما تضمن استمرارية البنية الترددية للحفاظ على جودة الإشارات. وهذا يمكّن النموذج من الحفاظ على تمثيلات ثابتة على الرغم من التشويش الزمني والتشوهات الطيفية، مما يجعل النظام أكثر مقاومة للتحديات الحقيقية.

أظهرت التجارب المكثفة أن هذه الطريقة تعزز بشكل كبير أداء الكاشف في ظروف العالم الحقيقي، مما يفتح الطريق نحو مستقبل أفضل في مجال معالجة الصوت والكشف عن التزييف. يمكنكم الاطلاع على الكود المصدر للتقنية من خلال هذا الرابط: TFCL Code.