تعتبر نماذج التفكير المتسلسل (Chain-of-Thought) أداة واعدة لمراقبة نماذج الذكاء الاصطناعي، ولكنها تثير تساؤلات حول التوازن بين الموثوقية والأمان. يتطلب الأمر من النماذج أن تكون موثوقة بما يكفي للتأكد من أنها تعتمد على سلسلة التفكير الخاصة بها، وفي نفس الوقت، قوية بما فيه الكفاية لرفض الاستنتاجات غير الآمنة. تؤكد دراسة جديدة تعد نماذج التفكير الذكي الحالية تواجه تحديات حقيقية في هذا المجال.

تقدم الدراسة، التي تستعرض نموذجاً يعتمد على بيانات بشرية يسمى HazMart، والذي يستخدم سيناريو بائع خضار ذكاء اصطناعي، حلولاً مبتكرة تهدف إلى تحسين الأمان والموثوقية. على خلاف الأبحاث السابقة التي كانت تركز على تقديم تلميحات ضمن المطالبات لاختبار الموثوقية، تم اقتراح تقنية جديدة تعرف باسم الاستبدال المستهدف في التفكير (Targeted Reasoning Replacement - TRR) التي تتدخل مباشرة في سلسلة التفكير لاستبدال الأفكار غير الآمنة أو غير المنطقية.

أظهرت نماذج مثل DeepSeek-R1-Llama-70B مستوى عالٍ من الموثوقية يصل إلى 97.5%، لكنها لم تنجح في رفض الاستنتاجات غير الآمنة، حيث بلغت نسبة الأمان 12.3%. وأثبت نموذج QwQ-32B أنه أكثر قوة، مع 73.9% من الأمان، ولكنه جاء بتكلفة انخفاض الموثوقية إلى 74.7%. تكشف التحليلات الميكانيكية لنموذج QwQ-32B عن وجود خصائص تمثل اتجاهات داخلية متضادة تصل إلى ذروة عند الرمز المرتبط بالإجراء.

في النهاية، تشير النتائج إلى أن توجيه التمثيل يمكن أن يعزز اتجاه الأمان بشكل مستقل، مما يزيد من سلوك الأمان بمقدار 9 نقاط مئوية مع الحفاظ على القدرات الأساسية للنموذج. هذه الابتكارات تمثل خطوات مهمة نحو تحقيق مزيد من الأمان في الذكاء الاصطناعي مع الحفاظ على موثوقيته.