في عالم الذكاء الاصطناعي، يعد التقييم الموثوق لتوجيه الأدوات من الأمور الحيوية، خاصة مع تزايد اعتماد نماذج اللغات الضخمة (Large Language Models) على التشغيل الذاتي كعوامل مستقلة. ومع ذلك، تعاني مقاييس التقييم الحالية من ثلاثة قيود هيكلية رئيسية، تجعلها غير كافية. أولاً، تتبع توزيعات البيانات قانون القوة، مما يترك السيناريوهات النادرة دون تمثيل كافٍ. ثانياً، غياب البيانات السلبية الصعبة يصعب التمييز بين أداء النماذج. وأخيراً، تعتمد أساليب التوصيف على أحكام نماذج اللغات الضخمة التي لم يتم التحقق من صحتها عبر التنفيذ.
لذا، نقدم PluginEval، وهو معيار تم بناؤه من خلال إطار عمل من خطوتين يهدف بصورة منهجية إلى التخفيف من هذه القيود. يتمثل النهج الأول في صياغة توجيه الأدوات كسلسلة من القرارات التي تفصل بين التوليد والتحقق. حيث تقترح نماذج اللغات الضخمة مكالمات مرشحة، بينما توفر عمليات التحقق المحددة وتنفيذ واجهات برمجة التطبيقات (APIs) إشارات جودة موثوقة.
في الخطوة الثانية، نحلل كل ملحق بناءً على الإمكانيات والنوايا وحدود الاستخدام لتحديد سيناريوهات التحفيز والاستبعاد. ثم نولد استفسارات بمستويات صعوبة مختلفة لسد الفجوات في التغطية، بما في ذلك بيانات سلبية تستهدف ثلاثة أنماط فشل، ثم نقوم بإعادتها إلى المرحلة الأولى للتوصيف، مما يخلق حلقة مغلقة تتكرر حتى converge التغطية.
وبالنسبة للتقييم، نتحرك بعيدًا عن دقة البيانات المجمعة، حيث يقوم قاضي النموذج بفرز الفشل إلى مكالمات مفقودة أو مكالمات خاطئة أو أخطاء في المعاملات، مما ينتج ملف تعريف خطأ مفصل لكل نموذج. كما نقوم بتقييم خمسة عائلات نماذج، بما في ذلك نماذج ملكية ونماذج بأوزان مفتوحة، ونحلل أدائها عبر مستويات الصعوبة وفئات الأخطاء، ونتحقق من اتفاقية القاضي مع التوصيفات البشرية.
يحمل PluginEval وعدًا كبيرًا في تعزيز كفاءة وتحديد الأخطاء في نماذج الذكاء الاصطناعي. كيف برأيك سيؤثر هذا الابتكار على مستقبل الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات.
PluginEval: معيار تشخيصي ثوري لتحديد الأخطاء الدقيقة في استدعاء الوظائف
يقدم PluginEval benchmark مبتكر لتقييم توجيه الأدوات في نماذج اللغات الضخمة (Large Language Models)، مما يساعد على تحسين دقة الأداء واستدعاء الوظائف. من خلال منهجية متطورة، يتم معالجة القيود الحالية وتقديم حلول فعالة لتحديد الأخطاء.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
