لقد أصبحت نماذج اللغات الآلية (LLMs) تُستخدم بشكل متزايد لتعمل نيابةً عن المستخدمين، ولكن المعيارات الحالية تركز عادةً على استرجاع الملف الشخصي، تقليد الأسلوب، أو الاستخدام العام للأدوات. في خطوة مبتكرة، تم تقديم معيار UserToolBench، الذي يهدف إلى تعزيز اتخاذ القرار المخصص داخل نماذج استخدام الأدوات.
هذا المعيار الجديد يختبر قدرة النماذج على استنتاج التفضيلات الخفية للمستخدمين من تاريخ التفاعل، والتعرف على متى يتطلب الأمر توضيحات، وإنتاج مسارات متوائمة مع المستخدمين تحت معلومات غير مكتملة. يعتمد UserToolBench على تتبعات تفاعل حقيقية تم معالجتها للحفاظ على الخصوصية، ويجمع بين ملفات شخصية منظمة، وتنسيقات أدوات مشابهة للـ API العامة، وغير ذلك.
يحتوي المعيار على 10 ملفات تعريف مستخدم، و36 مجموعة أدوات، و1,065 جولة، و170 أداة فريدة، وأنواع مهام مركزة على التقييم تشمل شح المعلومات، أداة واحدة، والإعدادات متعددة الأدوات.
أظهرت تجارب أجريت على نماذج LLMs قوية أن هذه النماذج لا تزال تعاني من صعوبات عند القيام بالتفويض المخصص. تظل التنسيق بين الأدوات المتعددة، واستنتاج القيد المفقود، والاتساق السلوكي على المدى الطويل عقبات كبرى. تشير هذه النتائج إلى ضرورة التحول في تقييم التخصيص بحيث يتجاوز السؤال عما إذا كانت المخرجات تبدو خاصة بالمستخدم، ليشمل ما إذا كانت نماذج LLMs تتخذ قرارات صحيحة للمستخدمين الذين تمثلهم.
هل أنتم متحمسون لهذا التقدم في مجال الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!
UserToolBench: معيار مبتكر لتخصيص اتخاذ القرار في نماذج اللغات الآلية
تمثل UserToolBench معيارًا جديدًا يُسهم في تحسين كيفية تعامل نماذج اللغات الآلية مع تفضيلات المستخدمين. تكشف النتائج عن صعوبات لا تزال تواجه النماذج في تقديم تجارب مخصصة للدعوة بدقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
