تشهد الأبحاث في الذكاء الاصطناعي تطوراً ملحوظاً، حيث تم إدماج نماذج اللغة الضخمة (Large Language Models) في مجالات علمية متعددة، لكن ما يتم تجاهله هو قدرتها على إعادة بناء المنطق الكامن وراء الأبحاث المنشورة. عادةً ما تحدد الأوراق البحثية إجراءات واضحة، ولكنها تترك العديد من التبعات المنهجية، مثل اختيار البيانات، وتصحيحات المعايرة، والافتراضات الضمنية، التي تبقى غير محددة.

هذا الغموض يزيد من صعوبة تقييم وكالات الذكاء الاصطناعي، حيث أن الفشل في استنساخ نتيجة معينة قد يعكس إما حدود الوكالة أو عدم التحديد في المصدر.

قام الباحثون بتقديم إطار عمل يُقيّم الوكالات من خلال الاستنساخ الشامل، الذي يفصل بين التنفيذ والتحقق، وكذلك الفشل الحسابي عن الغموض المنهجي. تم تطبيق هذا الإطار على أربع عشرة دراسة في علم الفلك، بما في ذلك دراسة من "المجلة الفلكية" واثنتي عشرة دراسة نُشرت في "ناتشر". حيث احتوت إحدى عشرة من الدراسات الثلاثة عشر على غموض يمنع وجود مسار استنساخ محدد بشكل فريد.

في دراسة حالة محكومة، أظهرت التحليلات الحساسية وجود تقديرات متباينة لنفس الكمية تتراوح من 2.16 إلى 3.53 كيلوبك (kpc)، مع استرداد قيمة منشورة واحدة فقط تقدر بـ 2.70 كيلوبك. والأهم من ذلك، أن القيمة المنشورة لم تُستخدم كهدف تحسين أو معيار اختيار، حيث تم العثور على المسار المطابق فقط بعد تشغيل جميع المسارات المحددة.

من المهم الإشارة إلى أن المعلومات الحاسمة (تصحيح مسافة بارالكس) كانت موجودة في الورقة بالفعل، لكن الوكالات لم تتعرف على أهميتها السببية حتى جعل التحليل التأثير واضحاً.

لذا، فإن مطابقة النتائج المنشورة لا تعني بالضرورة إعادة بناء المنطق الكامن، كما يمكن أن يكون الاختناق في بعض الأحيان ناتجاً عن فشل في الربط بين المعلومات ذات الصلة أكثر من استرجاعها. وهذا يجعل من الاستنساخ الشامل اختباراً للإمكانية التكرارية وإطاراً لتقييم المعرفة العلمية الضمنية في نظم الذكاء الاصطناعي.