في عالم التكنولوجيا الحديثة، تزايد استخدام نماذج اللغات الكبيرة (LLM) كأدوات لتجميع المعاملات، حيث يقوم المستخدم بالتعبير عن نواياه بلغة طبيعية، ثم تقوم النموذج بإصدار كائن منظم قابل للتنفيذ بواسطة واجهة برمجة التطبيقات (API). ولكن، هل يكفي الاعتماد على JSON Schema لضمان التنفيذ الآمن والدقيق لهذه المعاملات؟

أصدرت دراسة جديدة، موصوفة في البحث المرموق arXiv، أداة جديدة تُعرف باسم OrderBench، والتي تعتبر مقياسًا دقيقًا للموثوقية في وكالات طلب الطعام. تأخذ هذه الأداة في الاعتبار الأنماط النحوية وصلاحية المخطط وقرارات الحالة والدلالات الخاصة بالعناصر وسمات الحفظ، بالإضافة إلى قبول الأوامر غير الآمنة.

استمرت التجارب على أكثر من 2400 استدعاء من Nebius Token Factory عبر أربعة نماذج مفتوحة في وضعيتهما: النص فقط وJSON-schema. أظهرت النتائج أن المخرجات المتوافقة مع المخطط قد تكون مصحوبة بمعدلات خطأ دلالي مرتفعة. على الرغم من أن أعلى نموذج حقق 100% من صلاحية المخطط في كلا الوضعين، إلا أن النجاح الدلالي بقي قريبًا من 80%. أما النماذج الأضعف، فقد شهدت سجلًا مزدوج الرقم من قبول الأوامر غير الآمنة.

تمثل هذه الاكتشافات تحذيرًا هندسيًا واضحًا: يجب أن تُعتبر المخرجات المنظمة طبقة واجهة ضرورية، لكنها لا يمكن أن تحل محل التحقق من المجال والتنفيذ الآمن. لا يمكن أن تحقق الأداة استجابة دقيقة إذا لم نكن نتحقق من صحة المحتوى بشكل دقيق.