في عالم الذكاء الاصطناعي الحديث، تلعب نماذج اللغات الكبيرة (LLMs) دورًا أساسيًا في توفير المشاورة الاجتماعية اليومية. إلا أن تقييم قدرتها على التفكير الاجتماعي في هذه الحالات لا يزال يمثل تحديًا كبيرًا. فقد يحتاج هذا التقييم إلى إعدادات خاصة تمكن النموذج من فهم الحالات الاجتماعية التي يصفها المستخدمون بشكل موضوعي، بالإضافة إلى نقص الحقائق القابلة للتحقق بشأن نوايا الآخرين.
سعيًا للتغلب على هذه التحديات، تم تقديم نظام فوز (Fuse)، وهو إطار محاكاة متعدد الوكلاء يهدف لدراسة التفكير الاجتماعي المدعوم بالمستخدم. يعمل هذا النظام عن طريق السماح لوكلاء مختلفين، بما في ذلك وكيل يمثل المستخدم، بالتفاعل مع وكيل هدف له دوافع خفية. يتيح هذا التفاعل للمساعد المقيم تحليل دوافع الوكيل المستهدف وتقديم حقيقة موثوقة.
تم إثبات مصداقية المحاكاة من خلال دراسة شملت 24 ألف تعليق، حيث تم تطبيق نظام فوز على 12 نموذجًا من نماذج اللغات الكبيرة. أظهرت النتائج أن (i) وساطة المستخدم تزيد من صعوبة التفكير الاجتماعي؛ (ii) تُظهر نماذج اللغات الكبيرة حساسية منهجية للتهيئة المنحازة من قبل المستخدم؛ (iii) تتطلب النماذج تفاصيل أكثر مما يحتاجه البشر للوصول إلى توقع صحيح؛ (iv) لا تؤدي المحادثات الأطول دائمًا إلى تحسين الأداء، رغم أنها تتيح فرصًا لطرح أسئلة توضيحية.
نحن فخورون بأن نقدم نظام فوز ومجموعة بيانات تحتوي على 21 ألف مثال، مما يمثل خطوة رائدة في مجال تقييم التفكير الاجتماعي لنماذج الذكاء الاصطناعي. هل تعتقدون أن هذه الابتكارات ستغير من كيفية تفاعلنا مع الذكاء الاصطناعي في المستقبل؟ شاركونا آرائكم في التعليقات!
نظام فوز: ثورة جديدة في تقييم التفكير الاجتماعي لنماذج اللغات الكبيرة!
تقدم دراسة جديدة نظام فوز (Fuse) كأداة مبتكرة لتقييم التفكير الاجتماعي لدى نماذج اللغات الكبيرة (LLMs). يهدف النظام إلى تحسين الاستشارات الاجتماعية من خلال تقديم تحليل موثوق للأهداف والنيات الخفية للمستخدمين.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
