تزايد الاعتماد على نماذج اللغات الضخمة (Large Language Models - LLMs) في مساعدات الصوت للسيارات، مما يبرز أهمية معالجة القضايا المتعلقة بالأمان قبل تنفيذ الأوامر. تكمن المشكلة الأساسية في ربط الطلبات الطبيعية بوظائف السيارة، مما يفتح المجال لمخاطر أمنية خطيرة. في مرحلة ما قبل التنفيذ، يجب على النظام اتخاذ قرارات حساسة، مثل تنفيذ الأمر، أو رفضه، أو توضيحه، أو الحاجة إلى تأكيد، أو احتمالية تفعيل إجراءات الطوارئ.

للأسف، لم تقيم الدراسات السابقة هذا القرار قبل التنفيذ بشكل منفصل عبر الأدوار المختلفة للمتحدثين، والحالة الاجتماعية للتوثيق، وحالة السيارة، وتوافر الأدوات. لذلك، قدم الباحثون معيارًا جديدًا يتضمن 202 سيناريو لتقييم القرارات المرجعية ضمن تصنيف من سبع فئات.

تم تقييم نموذجين محليين ووزنيين مفتوحين وثلاثة نماذج LLMs قائمة على واجهة برمجة التطبيقات (API) باستخدام مقاييس توافق القرار وأخطاء الأمان المحددة. وأظهرت النتائج تنوعًا في نسبة التوافق، حيث تراوحت من 40.1% لنموذج Llama 3.2 3B إلى 89.1% لنموذج Gemini 3.1 Pro Preview. بينما حققت النماذج القائمة على API نسبة درجات تتراوح بين 83.2% و89.1%، مع عدم وجود فروق معنوية كبيرة بينها.

ومع ذلك، لا تزال هذه النماذج تنتج من اثنين إلى ثلاثة تنفيذات خطأ ضمن 161 سيناريو عدم التنفيذ، ولا تزال الأخطاء المتكررة موجودة في قرارات التأكيد والتحكم اليدوي. تحسين التحكم في نموذج Llama 3.2 3B في إطار السياسة المنظمة أدى إلى زيادة توافق بنسبة 40.1%، مقارنة بنسب تتراوح بين 28.2% و29.2% في المعايير التقليدية. ولكن حتى ذلك لا يلغي تنفيذات الخطأ.

لذلك، لا تعد القرارات المنظمة من نماذج اللغات الضخمة كافية كآلية أمان مستقلة، مما يشير إلى الحاجة إلى طبقة إنفاذ مستقلة للتحقق من أذونات الأدوات والقيود المرتبطة بحالة السيارة قبل استخدام أي وظيفة في السيارة.