في عالم نماذج اللغات الضخمة (LLMs)، تثير آلية رفض الإجابة تساؤلات عميقة حول كيفية معالجة النماذج للمعلومات. هل تم محو الإجابة الصحيحة عند رفض النموذج، أم أنها مُخنقة في مخرج البيانات؟ لتسليط الضوء على هذه المسألة، أجرينا دراسة جديدة تبين تباينًا مدهشًا يُطلق عليه 'تماثل مكسور'.
تُظهر نتائجنا أن رفض النموذج لا يعمل كمفتاح بسيط فعال، بل إن استعادة الإجابة الصحيحة يمكن أن تتم بكل سهولة من الحالات الداخلية للنموذج. على الرغم من أن النموذج قد يُظهر رفضًا واضحة، إلا أن الإجابة الصحيحة تبقى قابلة للاسترداد بسهولة.
إن إطلاق هذه الإجابة المحتجزة يتطلب تدخلاً محليًا فقط، مما يعني أننا بحاجة إلى تعديل صغير في الموقع. في القرارات المعاكسة، تكون الأمور معقدة، حيث يتطلب إعادة فرض الرفض تدخلاً أوسع عبر مواقع متعددة، مما يجعل تجميع تسلسل الرفض المتماسك أكثر صعوبة.
علاوة على ذلك، أظهرنا أن تفاوت التوزيع بين الإجابات والرفض لا يُمكن الاعتماد عليه كوحدة تحكم خطية لتبديل السلوكيات. وعليه، تنبئ نتائجنا بأن التحكم في سلوك النماذج يمكن أن يُبالغ فيه، كما أن اكتشاف اتجاهات الرفض لا يمنح القدرة الموثوقة لتوجيه النموذج من الإجابة إلى الرفض المتماسك.
يُظهر هذا البحث أهمية الفهم الجيد للآليات الداخلية التي تعمل بها نماذج اللغات الضخمة، ليس فقط من أجل تحسين أدائها، بل لضمان سلامتها وأمانها في مختلف التطبيقات.
استكشاف تطور غامض: لماذا تظل الإجابات مخفية في نماذج اللغات الضخمة؟
في دراسة جديدة على نماذج اللغات الضخمة (LLMs)، تم اكتشاف آلية فريدة توضح كيف أن رفض النموذج للإجابة لا يعني بالضرورة محو الإجابة الصحيحة. تكشف الأبحاث عن تباين مدهش في كيفية استعادة المعلومات الخفية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
