تُعَدّ نماذج التفكير الكبيرة (Large Reasoning Models) من أقوى الابتكارات في مجال الذكاء الاصطناعي، حيث تُظهر قدرة مذهلة على حل المشكلات. ورغم ذلك، تواجه هذه النماذج تحدياً كبيراً عندما يتعلق الأمر بمعالجة الاستفسارات الضارة. دراسات سابقة أظهرت أن الأمان في هذه النماذج يتدهور بشكل كبير في مثل هذه الحالات.

في هذا السياق، تقدم أحدث الأبحاث تحليلاً جديداً حول كيفية حدوث الفشل في السلامة من خلال دراسة سلوك الرموز بشكل دقيق. قام الباحثون بتحليل دقيق لديناميات الرفض، ووجدوا أن هناك هشة تتعلق بالتزامني الزمني عند بداية التفكير، والتي أطلقوا عليها اسم انهيار الرفض في بداية التفكير (Onset Refusal Collapse - ORC).

لقد أظهرت النتائج أن الإشارات المتعلقة بالرفض لدى نماذج التفكير الكبيرة تنخفض بشكل حاد عند أول رمز يتم توليده عند مواجهة استفسارات ضارة، مما يؤدي إلى استجابات غير آمنة.

استجابةً لهذه الاكتشافات، ابتكر الباحثون تقنية جديدة تُسمى SafeToken، وهي تدخل خفيف الوزن يتم تطبيقه خلال عملية الاستنتاج، حيث يتم إدخال رُسُوم تعلمية مستمرة في اللحظة الحرجة من بداية التفكير. على الرغم من أن SafeToken يعدل فقط تمثيل رمز واحد، إلا أنه يمكنه تقليل تأثير ORC بشكل فعّال، كما يحسن من السلامة في اختبارات الاستفسارات الضارة، مع الحفاظ إلى حد كبير على قدرة النموذج على التفكير.

تشير هذه النتائج إلى أن فشل السلامة في نماذج التفكير الكبيرة قد يحدث نتيجة انهيار مؤقت خلال الانتقال الحرج من الفهم إلى الإنتاج. هل ستؤدي هذه التطورات إلى تحسينات حيوية في أمان الذكاء الاصطناعي؟