في ظل الاعتماد المتزايد على أنظمة الذكاء الاصطناعي (AI) في اتخاذ القرارات، جاء التشريع الأوروبي للذكاء الاصطناعي (EU AI Act) ليتطلب من مقدمي خدمات الأنظمة عالية المخاطر تقديم وثائق تقنية تشرح كيفية اتخاذ هذه الأنظمة لقراراتها. تمت دراسة "التفسير الميكانيكي" (Mechanistic Interpretability) كأحد المصادر الواضحة لهذه الأدلة، حيث يعتبر اكتشاف الدوائر (Circuit Discovery) الأدوات الأكثر تطورًا في هذا المجال.

طرحت دراسة جديدة سؤالًا مهمًا: هل يمكن الاعتماد على الأدلة المستخلصة عندما يتعلق الأمر بتحليل نظام واحد بواسطة محللين مختلفين؟ قام الباحثون بتسجيل مجموعة من التحليلات المتقاطعة، وتمت دراسة 15,840 وصفًا مسجلاً مسبقًا على نموذج GPT-2 ومهمة تحديد الكائنات غير المباشرة.

ازدادت التعقيدات عندما أظهرت النتائج أن 73.2% من أزواج المواصفات تؤدي إلى نتائج متناقضة، مما يثير تساؤلات حول موثوقية الوثائق الفنية. تبين أيضًا أن الدوائر المستخدمة في تلك الادعاءات كانت غير متداخلة تقريبًا، مما يوحي بأن عدم الاستقرار ليس مجرد مشكلة تعبيرية بل هيكلية.

وقد أوضحت الدراسة أن أحد الأهداف الموثقة لم يكن قادرًا على التنفيذ على المهمة المحددة، مما يزيد من مخاوف الاستقرار بشكل عام. تبقى الأسئلة حول ما إذا كانت هذه النتائج تنطبق على نطاق أوسع دون اختبار.