ليس سراً أن التنبؤ بالرموز هو جوهر عمل نماذج اللغة (Language Models)، ولكن هل الأمر يتجاوز ذلك؟ سؤال عميق يطرحه الباحثون في دراسة جديدة تهدف إلى قياس "فهم" هذه النماذج من خلال مفهوم عدم وجود تحكم (No-Arbitrage).

تحدد الدراسة أن النموذج يفهم مفرداته بشكل معين إذا لم يكن بإمكان تاجر محدود الحواسيب تحقيق ربح مضمون من خلال المراهنة ضد احتمالات النموذج على ادعاءات منطقية مُرتبطة.

أبرزت الدراسة ثلاثة نتائج نظرية:
1. لأن الاتساق المنطقي الكامل يعد عملاً غير قابل للحساب، فإن الفهم يكون دائماً متدرجاً، وليس مطلقاً.
2. تم إثبات أن التحسين الدقيق للتنبؤ بالرمز التالي يعد غير متسق عبر تنسيقات مختلفة للأسئلة؛ العطب يعود إلى هدف التدريب وليس إلى الهيكل.
3. أظهر الباحثون أن عدم اليقين يتراكم بشكل يمكن التنبؤ به على طول سلاسل التفكير، مما يجعل الثقة الزائدة غير المبررة فرصة للمقايضة في حد ذاتها.

لمعالجة هذه القضايا، تم تقديم إطار العمل Arbitr، حيث يقوم تاجر معادٍ بمعاقبة النموذج بسبب التناقضات المنطقية، مقترناً بدعامة معايرة لمنع الانهيار غير المعلوماتي.

من خلال خمسة تجارب مُسجلة مسبقاً على نماذج Qwen2.5 و Phi-3.5، تم إثبات أن النماذج النموذجية تعد قابلة للاستغلال بشكل كبير عبر عبارات مختلفة. تُقلل Arbitr من هذا الاستغلال بمقدار كبير دون التضحية بدقة المهمة.

يٌكشف في هذا البحث أيضاً وهم التوسع: عند 7 مليارات معلمة، غالبًا ما تتزامن قلة الاتساق المُقاسة مع ثقة غير مبررة.

بخلاصة، على الرغم من أن إطار العمل Arbitr يفرض اتساقاً منطقياً صارماً، فإن الاتساق يعد شرطاً ضرورياً للمعرفة، لكنه ليس شرطاً كافياً.