في عالم الذكاء الاصطناعي، تلعب نماذج اللغة الكبيرة (Large Language Models) دورًا بارزًا في بناء تفاعلات متقنة تشبه البشر. لكن، ماذا يحدث عندما تفشل هذه النماذج في تمثيل الشخصيات بدقة؟ في هذا السياق، تم الكشف عن معيار جديد يُسمى CHARM، والذي يهدف إلى تقييم هذه الظاهرة بشكل منهجي.

معيار CHARM يتضمن 40 شخصية من واقع الحياة أو الخيال، مستمدة من خمس مناطق ثقافية لغوية، وقد تم التحقق من دقتها من قبل مراجعين محليين. يركز هذا المعيار على نوعين من الحدود التي يجب على النماذج الالتزام بها: الحدود الزمنية (التاريخية مقابل الحديثة) والحدود عبر الكون (الكيانات التي تخرج عن قصة الشخصية).

يعتمد المعيار على أسئلة متعددة الخيارات تتيح للنماذج الخيار بين الإجابة أو الامتناع، مما يساعد على قياس وعي النموذج بالحدود المعرفية. يُظهر البحث أن الكثير من حالات التشويش تحدث بسبب فشل النموذج في الالتزام بالحقائق المرتبطة بالشخصية، مما يؤدي إلى تقديم إجابات غير دقيقة رغم معرفة النموذج بخروج السؤال عن نطاق الشخصية.

أجريت تقييمات على ستة نماذج للغة، وأظهرت النتائج أن الفشل في الالتزام هو السبب الرئيسي وراء تشويش الشخصيات. كما كشفت الدراسة عن وجود تباين ثقافي منهجي في هذه الأخطاء، مما يشير إلى عدم التوازن في كيفية تمثيل نماذج المعرفة للشخصيات من مناطق مختلفة. هذا النموذج يعد خطوة مهمة نحو فهم أعمق لكيفية تحسين نماذج اللغة الكبيرة في تقمص الشخصيات المختلفة.

ما رأيكم في هذا التطور؟ شاركونا في التعليقات!