في عالم نماذج اللغات الضخمة (LLMs)، تثير آلية رفض الإجابة تساؤلات عميقة حول كيفية معالجة النماذج للمعلومات. هل تم محو الإجابة الصحيحة عند رفض النموذج، أم أنها مُخنقة في مخرج البيانات؟ لتسليط الضوء على هذه المسألة، أجرينا دراسة جديدة تبين تباينًا مدهشًا يُطلق عليه 'تماثل مكسور'.

تُظهر نتائجنا أن رفض النموذج لا يعمل كمفتاح بسيط فعال، بل إن استعادة الإجابة الصحيحة يمكن أن تتم بكل سهولة من الحالات الداخلية للنموذج. على الرغم من أن النموذج قد يُظهر رفضًا واضحة، إلا أن الإجابة الصحيحة تبقى قابلة للاسترداد بسهولة.

إن إطلاق هذه الإجابة المحتجزة يتطلب تدخلاً محليًا فقط، مما يعني أننا بحاجة إلى تعديل صغير في الموقع. في القرارات المعاكسة، تكون الأمور معقدة، حيث يتطلب إعادة فرض الرفض تدخلاً أوسع عبر مواقع متعددة، مما يجعل تجميع تسلسل الرفض المتماسك أكثر صعوبة.

علاوة على ذلك، أظهرنا أن تفاوت التوزيع بين الإجابات والرفض لا يُمكن الاعتماد عليه كوحدة تحكم خطية لتبديل السلوكيات. وعليه، تنبئ نتائجنا بأن التحكم في سلوك النماذج يمكن أن يُبالغ فيه، كما أن اكتشاف اتجاهات الرفض لا يمنح القدرة الموثوقة لتوجيه النموذج من الإجابة إلى الرفض المتماسك.

يُظهر هذا البحث أهمية الفهم الجيد للآليات الداخلية التي تعمل بها نماذج اللغات الضخمة، ليس فقط من أجل تحسين أدائها، بل لضمان سلامتها وأمانها في مختلف التطبيقات.