في عالم الذكاء الاصطناعي، يعد استدعاء الأدوات في الأدوار المتعددة تحديًا رئيسيًا للنماذج اللغوية الضخمة (LLM) التي تهدف إلى تقديم أداء متميز. وفقًا لدراسة حديثة نُشرت على arXiv، اقتربت النماذج ذات الأوزان المفتوحة من تحقيق نفس دقة النماذج المغلقة، بل تجاوزتها في بعض الأحيان. ومع ذلك، فإن قراءة التحسين بهذه الطريقة تخفي العديد من العوائق التي تواجه النماذج.
تقدم الدراسة إطارًا تشخيصيًا موجهًا نحو فئات الأفعال، يتضمن تحليل الأخطاء إلى نوعين رئيسيين: عدم ضبط فئة العمل وفشل تنفيذ العمل. يعتمد الإطار على مساحة أفعال مكونة من أربع فئات (TOOL_CALL/ASK/REFUSE/CONFIRM) ويدخل مؤشرًا للكفاءة يوضح الأخطاء بوضوح.
عند الاختبار عبر مجموعة من نماذج استدعاء الأدوات، تبيّن أن عدم ضبط فئة العمل هو مصدر رئيسي لفشل لا يمكن لمقياس الحالة كشفه. كما تتفاوت تأثيرات الضبط بناءً على نوع المحفزات، حيث يمكن لمؤشر واحد أن يرفع أو يخفض دقة النموذج بشكل كبير. لذلك، يجادل الباحثون بأن التقييم الدقيق لنماذج استدعاء الأدوات يجب أن يتجاوز الاعتماد على الكفاءة الإجمالية، ويتضمن تشخيص فئات الأفعال لفهم الأداء الفعلي للنموذج في كل سيناريو.
هذه النتائج تقدم دعوة لتجديد الأساليب المتبعة في تقييم النماذج اللغوية وتؤكد على أهمية دراسة تأثير السياق في تحسين أداء النماذج.
هل يمتلك الذكاء الاصطناعي القدرة على تحسين دقته؟ اكتشاف عوائق ضبط الأداء في النماذج اللغوية!
تظهر الأبحاث الجديدة أن دقة النماذج اللغوية الضخمة (LLM) قد تتأثر بعيوب في ضبط الأداء عند استدعاء الأدوات. تعرّف على كيفية تحسين تقييم الأداء في السيناريوهات متعددة الأدوار.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
