في عالم الذكاء الاصطناعي المتطور سريعاً، تبرز نماذج اللغة الكبيرة (Large Language Models) كأبطال للابتكار. هذه النماذج تجمع بين مراحل الإنتاج واستراتيجيات صنع القرار والتنفيذ والتقييم الذاتي ضمن حلقة واحدة. ولكن، على الرغم من فعالية هذه النماذج، إلا أن هناك فخاخاً يجب تجنبها.

حالياً، تعمل هذه النماذج تحت مواصفات خارجية مثل تعليمات المهام، والارشادات، والمخططات. ورغم ذلك، فإن هذه المواصفات غالباً ما تتواجد في سياق النموذج الذي يقوم بالعمل ويعلن إتمامه، مما يترك فجوة واضحة في مجال الالتزام بالمواصفات.

تم تحديد فجتين رئيسيتين في هذا السياق:

1. **فجوة الفهم والتنفيذ**: تحدث هذه الفجوة عندما يُفهم الطلب بشكل صحيح، لكنه لا يتم تلبيته أثناء التنفيذ، مما يؤدي إلى نتائج غير مُرضية.

2. **فجوة الحالة والسلطة**: تنشأ هذه عندما لا تُرسخ الادعاءات الخاصة بالكمال أو تفسير الوكيل للحالة المطلوبة.

استخدمت التجارب على منصة SkillsBench 509 توجيهات مهام مستندة إلى مصادر، واستُخدمَت نماذج متعددة لتحقيق النتائج. ومع ذلك، لم تتجاوز نسبة التلبية 86.4%، مما يوضح وجود تحدٍ حقيقي يتعلق بمصداقية الوكلاء.

من الضروري الفصل بين مقترحات الوكيل والدولة المقررة. يمكن للوكلاء أن يخططوا ويتخذوا الإجراءات، لكن فقط الأدلة القابلة للتحقق من مزودين مؤهلين يمكن أن تؤسس حالة مُدارة بالمواصفات.

لذا، فإننا بحاجة إلى مبادئ واضحة مثل SpecHarness التي تدمج المواصفات الرؤية في التزامات مرتبطة بالمصادر، وتدير العمليات والتأكيد النهائي من خلال حالة الالتزامات المحدثة.

تظهر التجارب على المهام الملتزمة بالإرشادات وكيفية إنتاج الأدوات، بأن المواصفات لا تعمل فقط كدليل سلوكي، بل كسلطة على التنفيذ وإتمام العمل بشكل compliant. لنحقق تقدماً حقيقياً في هذه التكنولوجيا، يجب أن نسمح للمواصفات بأن تكون السائق وليس الوكلاء.