تُعتبر نماذج اللغة الكبيرة (LLMs) من التطورات الرائدة في مجال الذكاء الاصطناعي، لكن يواجه الكثير منها مشكلة الرفض المفرط، حيث ترفض تعليمات غير ضارة حتى عندما تكون مرتبطة بالأمان. تكشف دراسات سابقة أن هذه المشكلة تتسبب بها تمثيلات ثابتة، لكن الأبحاث الجديدة تقدم فهماً أعمق للعوامل الديناميكية التي تساهم في ذلك.

في ورقة بحثية حديثة، قام الباحثون بتحليل الآليات الداخلية للصراعات في انتباه محولات (Transformers) النماذج. وقد اكتشفوا مجموعة نادرة من "رؤوس الأمان فائقة الحساسية" التي تُخطئ في فهم التعليمات الآمنة، مشدودين بشكل غير طبيعي إلى المعاني الرافضة وتعاني من صراعات شديدة في التوجيه.

لتلبية هذه التحديات، قدم الباحثون تقنية جديدة تسمى "ضبط التوجيه الدلالي" (Semantic Routing Calibration - SRC)، وهي إطار عمل خفيف الوزن لا يتطلب تدريباً إضافياً. تعمل SRC على عزل وتقليل نشاط رؤوس الأمان فائقة الحساسية في مرحلة الاستدلال، مما يعزز قدرة النماذج على تقديم استجابات موثوقة.

من خلال دمج SRC مع تصنيف مزدوج يساعد في تنظيم الأمان خلال فك التشفير، تمكّن الأبحاث الجديدة من تقليل مشكلة الرفض المفرط دون التفريط في الأداء الأمان الداخلي للنماذج. اختبارات واسعة زادت من إيضاح فعالية SRC، موفرة حلاً عملياً لمشكلة تؤثر على أداء نماذج اللغة الكبيرة.

ما رأيكم في هذه التقنية الجديدة؟ هل تعتقدون أنها ستحدث فارقاً في تطوير نماذج اللغة الكبيرة؟ شاركونا في التعليقات!