في عالم الذكاء الاصطناعي المتقدم، تسعى نماذج اللغة الشخصية (Personalized Large Language Models - PLLMs) إلى تخصيص الاستجابات بما يتناسب مع احتياجات المستخدمين الفردية. لكن، يكمن التحدي الرئيسي في كيفية استنتاج التفضيلات ذات الصلة من السجلات السابقة للمستخدم.
تعتمد معظم المعايير الحالية على الفرضية القائلة بأن التفضيلات يمكن استردادها من تاريخ مرتبط دلالياً. ولكن، هناك جانب مهم لم يتم استكشافه حتى الآن، وهو "تعارض مفاهيم السير الذاتية والتفضيلات" (Profile-Preference Conceptual Misalignment - PRCM). هذا التعارض يحدث عندما تشير الدلائل المرئية من الملف الشخصي والتفضيلات الخاصة بالاستفسارات إلى مفاهيم مختلفة، مما يجعل الاسترداد الدلالي غير موثوق به في عمليات التخصيص.
لذا، تم تقديم VIBE-Bench كمعيار جديد يتضمن مهام قائمة على علم النفس، ويتضمن بيانات شاملة تضم 3,504 شخصية و12,239 حوار، بما في ذلك مجموعة اختبار مدققة يدوياً. تتطلب هذه المنصة التفكير العميق خارج إطار التداخل الدلالي السطحي.
أظهرت التجارب مع عدة طرق للتخصيص أن معظم نماذج اللغة الشخصية الراهنة تعتمد بشكل كبير على الارتباطات الدلالية السطحية، مما يفشلها في الحصول على خرائط قوية عبر المفاهيم. هذه النتائج تثبت أن PRCM هو نظام فشل مميز في PLLMs وتضع VIBE-Bench كمنصة اختبار مركزة لدفع تفكير التفضيلات إلى ما وراء المطابقة الدلالية.
VIBE-Bench: منصة جديدة لتحسين نماذج اللغة الشخصية من خلال فهم عميق للتفضيلات
تقدم VIBE-Bench نهجاً جديداً لتقييم نماذج اللغة الشخصية (PLLMs) من خلال تسليط الضوء على أهمية الربط بين السير الذاتية والتفضيلات. تعزز هذه المنصة من قدرة النماذج على فهم المفاهيم بشكل أعمق لتقديم استجابات أفضل.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
