مع زيادة تشديد تنظيمات السيادة البيانات، تجد المؤسسات العامة نفسها مطالبَة باستغلال نماذج اللغة الكبيرة (Large Language Models) مفتوحة المصدر، والتي يمكنها تنفيذ مكالمات متعددة للأدوات عبر واجهات برمجة التطبيقات المعيشية (live APIs). ومع ذلك، يُظهر الأداء الفعلي لنماذج المصدر المفتوح تراجعًا واضحًا في هذا السياق المتعدد الخطوات، مما يبرز الحاجة إلى معيار قياسي لتحديد الفجوة.

للمضي قدمًا، تم تقديم معيار جديد يُعرف باسم "Korean Open Public API Benchmark" (KOPA-Bench)، والذي يتضمن 145 مهمة حقيقية تتعلق بالخدمات العامة. ولتجاوز الفجوة، تم تقديم "EDGE"، وهو مخطط ديناميكي قائم على التنفيذ للاتصال بالأدوات، حيث يعتمد على التنفيذ المباشر.

يعمل EDGE على بناء رسم توضيحي حول كيفية تغذية مخرجات كل أداة لمدخلات أداة أخرى، مع الاحتفاظ فقط بالروابط التي تنجح عند الاتصال الفعلي بواجهات برمجة التطبيقات. من خلال استكشاف هذه الروابط التي تم التحقق منها، يمكن تشكيل مسارات متعددة الخطوات قابلة للتنفيذ.

عبر تحسين النموذج بحجم 9 مليارات عبر قاعدة البيانات الناتجة، يقارب أداؤه أداء النموذج غير المحسن بحجم 27 مليار من نفس العائلة، مما يحقق تحسينًا ملحوظًا ليس فقط في معيار KOPA-Bench ولكن أيضًا في معيار BFCL.

هذا التطور يمثل قفزة نوعية في كيفية تعامل المؤسسات العامة مع البيانات، ويثير التساؤلات حول مستقبل التعاون بين الذكاء الاصطناعي وواجهات برمجة التطبيقات العامة.