في خطوة جديدة ورائدة لفهم تأثير واجهات المستخدم على أداء نماذج الذكاء الاصطناعي، تم نشر دراسة تبرز دور الواجهة في تقييم الاستدعاءات للأدوات. أظهرت التقييمات أن معدلات الاستدعاء يمكن أن تظل صفرية حتى عندما يقوم النموذج بإصدار استدعاءات منسقة بشكل جيد. يعود ذلك إلى أن الواجهة تقوم برفض المسار قبل أن يتمكن أي جزء من النظام من رؤيته.

عند استخدام بيانات نموذج BFCL v4، تبين أنه مع تثبيت الأوزان والحالات وتقنيات التشفير، إلا أن أداء النموذج يتغير اعتمادًا على محول الخدمة، حيث سجل أداء النموذج 0.00 أو 0.96 / 0.19 في حالات مختلفة.

كما تمت دراسة تأثير المحول من خلال مجموعة من المهام التفاعلية، حيث ارتفع عدد الاستدعاءات الخادمة من 0 إلى 636، مما يبرز مدى فعالية التعديل البسيط على واجهة المستخدم. في تجربة مع نموذج Qwen2.5-Coder، أظهر التحليل أن النموذج يمكن أن يتجاوز قيود الأداء بينما تظل النسبة الصامتة استمرت في النطاق 0-2%.

من خلال هذه النتائج، يتضح أن معدل استدعاء الأدوات ليس فقط خاصية للنموذج، بل هو نتيجة لواجهة النموذج التي تقيسه. ومع إدخال بعض التحسينات في الانتقال، يمكن تحسين الأداء العام للنموذج، بالرغم من أن المكاسب ليست دائما ذات دلالة إحصائية.

تفتح هذه الدراسة آفاقًا جديدة لفهم كيفية تصميم الواجهات لتحسين أداء أدوات الذكاء الاصطناعي، مما يمهد الطريق لمزيد من الأبحاث والابتكارات في هذا المجال.