تشهد نماذج اللغات الكبيرة (Large Language Models) زيادة في استخدامها كمقيمين ضمن تقييم استرجاع المعلومات (Information Retrieval)، مما يطرح تساؤلات حول كيفية تأثير تكوين المقيمين على موثوقية الحكم والمقارنة بين الأنظمة في المستقبل.
أجريت دراسة تتناول تأثير أنماط الشخصيات (Persona Conditioning) كآلية تشخيصية لإظهار حساسية المقيمين من نماذج اللغات الكبيرة. اعتمد الباحثون على أنماط شخصية مستمدة من مصدرين تكامليين: PersonaHub وNVIDIA Nemotron-Personas-USA، حيث تم إنشاء خمسة أدوار تقييم تركز على فهم النوايا، الخبرة في المجال، الحكم المتباين، التحقق من الأدلة، وتقييم جودة البحث الشاملة، بالمقارنة مع معيار UMBRELA.
أظهرت التحليلات على ستة نماذج لغوية مختلفة قبالة TREC DL20 وRAG24 أن الحساسية تبين هيكلية بدلاً من كونها موحدة. وبالرغم من الاحتفاظ بالحكم قريباً من الأساس، إلا أن الصرامة في التقييم أو عتبة الأدلة أو التأكيد على التفسير تغيرت، دون حدوث انقلابات واسعة النطاق في الصلة.
على مستوى النظام، حافظت النماذج ذات السعة العالية على اتفاقية الترتيب بين الأنظمة، بينما عكست النماذج الأصغر زيادة في عدم الاستقرار الناتج عن الأنماط الشخصية. كما كشفت التحليلات المحلية عن تركيز حساسيات المقيمين على أنظمة معينة، وخاصة أنظمة الترتيب العصبية على DL20 وأنظمة موجهة نحو RAG على RAG24. يبدو أن مصدر الأنماط الشخصية أقل تأثيراً من دور المقيم وسعة النموذج.
تقدم هذه النتائج فهماً أعمق لتكوين المقيمين كشريط اختبار حساس لمحاكاة تقييم استرجاع المعلومات المعتمد على نماذج اللغات الكبيرة، ومساعدتنا في التعرف على الأنظمة التي تكون نتائج تقييمها حساسة لتأطير المقيم. هل تتفق مع نتائج هذه الدراسة؟ شاركنا برأيك في التعليقات!
كيف تغير أنماط الشخصيات في نماذج اللغات الكبيرة دقة تقييم استرجاع المعلومات؟
تسعى الدراسة إلى فهم تأثير أنماط الشخصيات على دقة نماذج اللغات الكبيرة (LLMs) في تقييم استرجاع المعلومات. النتائج تكشف عن حساسية متفاوتة للمقيمي على مستويات متعددة، مما يعيد تشكيل فهمنا لكيفية تقييم الأنظمة المعلوماتية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
