في عالم الذكاء الاصطناعي، يعد استدعاء الأدوات في الأدوار المتعددة تحديًا رئيسيًا للنماذج اللغوية الضخمة (LLM) التي تهدف إلى تقديم أداء متميز. وفقًا لدراسة حديثة نُشرت على arXiv، اقتربت النماذج ذات الأوزان المفتوحة من تحقيق نفس دقة النماذج المغلقة، بل تجاوزتها في بعض الأحيان. ومع ذلك، فإن قراءة التحسين بهذه الطريقة تخفي العديد من العوائق التي تواجه النماذج.

تقدم الدراسة إطارًا تشخيصيًا موجهًا نحو فئات الأفعال، يتضمن تحليل الأخطاء إلى نوعين رئيسيين: عدم ضبط فئة العمل وفشل تنفيذ العمل. يعتمد الإطار على مساحة أفعال مكونة من أربع فئات (TOOL_CALL/ASK/REFUSE/CONFIRM) ويدخل مؤشرًا للكفاءة يوضح الأخطاء بوضوح.

عند الاختبار عبر مجموعة من نماذج استدعاء الأدوات، تبيّن أن عدم ضبط فئة العمل هو مصدر رئيسي لفشل لا يمكن لمقياس الحالة كشفه. كما تتفاوت تأثيرات الضبط بناءً على نوع المحفزات، حيث يمكن لمؤشر واحد أن يرفع أو يخفض دقة النموذج بشكل كبير. لذلك، يجادل الباحثون بأن التقييم الدقيق لنماذج استدعاء الأدوات يجب أن يتجاوز الاعتماد على الكفاءة الإجمالية، ويتضمن تشخيص فئات الأفعال لفهم الأداء الفعلي للنموذج في كل سيناريو.

هذه النتائج تقدم دعوة لتجديد الأساليب المتبعة في تقييم النماذج اللغوية وتؤكد على أهمية دراسة تأثير السياق في تحسين أداء النماذج.