أصبحت نماذج اللغات الضخمة (Large Language Models) أدوات مهمة في العديد من السياقات، ولكن مسألة موضوعية تقييماتها لطالما كانت محط تساؤل. نقدم لكم إطار العمل الجديد المنطلق من دراسة حديثة بعنوان JudgeProfile، والذي يعيد تحليل كيفية قيام قضاة LLM بتقييم ردود الفعل.
تتجلى الموضوعية في كثير من الأحيان كحالة من التفضيلات الشخصية، فهل يمكن لقضاة LLM أن يظهروا تباينًا في اختياراتهم حتى وإن كانت الخيارات المتاحة غير خاطئة؟ للإجابة على هذا السؤال، جمع الباحثون مجموعة بيانات تُعرف بـ SubjectiveSet، والتي تضم 50,013 مجموعة من الردود تم أخذها من 17 مصدر بيانات عام، وتم تقييمها بواسطة 21 قاضي LLM وفقًا لـ 87 سمة مختلفة.
من المثير أن النتائج أظهرت وجود توافق خفي في إدراك القضاة، حيث اتفق القضاة في تقييم العديد من السمات حتى وإن اختلفت خياراتهم النهائية. كما أظهر الباحثون كيف يمكن تقدير أوزان السمات الخاصة بكل قاضٍ من اختياراته العامة، مما يعكس تنوعًا في الأولويات حتى لدى القضاة الذين يقيّمون نفس مجموعة السمات.
ولتحسين توافق النتائج، تم تطوير أوزان جديدة استنادًا إلى تسميات مرجعية. ووجد الإطار أن إعادة الوزن للسمات المدركة أسهم في تعزيز توافق النتائج من 66.48% إلى 71.97%، متفوقًا بذلك على تقنيات مثل تعديل النماذج والشكل الموجه للسمات.
تكمن أهمية هذه الدراسة في ضرورة فهم قاعدة اختيار القضاة وتأثير ضمني على كيفية توجيه الموضوعية في القرارات، مما يفتح أفقًا جديدًا في عالم الذكاء الاصطناعي.
ما رأيكم في هذه التطورات المثيرة؟ هل تعتقدون أن موضوعية قضاة LLM يمكن أن تتحسن أكثر؟ شاركونا آرائكم في التعليقات!
هل يمكننا إشراف المصداقية في قضاة نماذج اللغات الضخمة؟ اكتشفوا جواب ذلك!
تم تقديم إطار عمل جديد يدعى JudgeProfile لفهم كيفية تقييم قضاة نماذج اللغات الضخمة (LLM) وموضوعية أحكامهم. تبين الدراسة أن قضاة LLM يفضلون أحياناً استجابات مختلفة رغم عدم وجود خطأ موضوعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
