أصدرت دراسة جديدة نتائج مثيرة حول قابلية رصد نماذج الذكاء الاصطناعي باستخدام طريقة الرصد المعروفة باسم Chain-of-Thought (CoT). تعتبر هذه الطريقة واعدة في الكشف عن سلوكيات غير مرغوبة للنماذج. لكن ما هو تأثير العمارة الحلقيّة (Looped Architecture) على قابلية الرصد هذه؟

تتعامل العمارة الحلقيّة مع نماذج اللغة عن طريق تطبيق طبقات محوّلة مشتركة بشكل متكرر، مما يزيد عمق الحساب الفعّال ويتيح عمليات حوسبة إضافية دون زيادة حجم النموذج. ومع ذلك، فإن تأثير هذه العمارات على قابلية الرصد باستخدام CoT لم يُستكشف بشكل كافٍ.

في هذه الدراسة، تم إجراء التقييم الأول من نوعه لقابلية الرصد لنماذج LoopLM. تم اختبار حالتين متكاملتين: الأولى تتعلق بتغيير عمق الحلقة داخل نفس عائلة LoopLM لعزل تأثير الحوسبة المتكررة، والثانية تقارن بين LoopLMs ونماذج غير حلقية لها نفس عدد المعلمات، حيث تم قياس قابلية الرصد.

على مدار ثماني مهام من MonitorBench في إعدادات قياسية وإجهاد، لوحظت انخفاضات معتمدة على المهام في قابلية رصد CoT تحت اختبارات الإجهاد في مهام محددة تتعلق بالمنطق والعلوم والهندسة، بينما أظهرت مهام أخرى اتجاهات أضعف أو مختلفة نوعيًا.

تشير تشخيصاتنا إلى أن هذه الانخفاضات لا يمكن تفسيرها بالكامل من خلال صعوبة المهام أو معدل التحقق أو طول الرموز المولدة، حيث تبرز أمثلة نوعية تغييرات في كيفية استخدام أو نسبة قنوات التوجيه المقدمة في نماذج الحلقات الأعمق.

ستجد دراستنا أن نماذج LoopLM ليست بالضرورة أقل قابلية للرصد من النماذج غير الحلقيّة عند المقارنة وفقًا للحجم أو العمق. بصفة عامة، تشير النتائج إلى أن زيادة عمق الحلقة يمكن أن تقلل من قابلية الرصد في بعض المهام تحت اختبارات الإجهاد، ولكن العمارة المحوّلة الحلقيّة بمفردها لا تعني بشكل تلقائي انخفاض القابلية للرصد.