تُعتبر أفكار البحث التي تولدها نماذج اللغات الكبيرة (LLMs) من المواضيع المثيرة للجدل، حيث يواجه الباحثون صعوبة في تقييم قيمتها العلمية بشكل موضوعي. للتغلب على هذا التحدي، تم تطوير "ساحة التفكير" (Ideation Arena)، وهي منصة جديدة تعتمد أسلوب المعارك لتقييم الأفكار عبر تقييمات بشرية مباشرة.

تتيح هذه المنصة إمكانية تقييم أفكار تم توليدها بواسطة 14 نموذج لغوي متقدم و5 هياكل بحثية مبنية على نموذجين أساسيين. لخلق نقطة انطلاق مشتركة، تعتمد ساحة التفكير على سياقات أدبية مأخوذة من أبحاث معروفة للباحثين المشاركين، مما يضمن تقديم نفس السياقات لجميع النماذج اللغوية والعملاء.

خلال العملية، تم جمع أكثر من 6000 مقارنة مزدوجة مُعمّاة من 105 باحثين نشطين في مجال علوم الحاسوب، مما أسفر عن إنشاء قائمة تصنيف (Elo rating leaderboard) تفضيلات الخبراء في مرحلة مقترحات البحث.

أظهر التحليل أن هناك تفاوتًا ملحوظًا في كفاءة الوكلاء، حيث قامت بعض الأطر بتحسين جودة الأفكار مقارنة بنماذجها الأساسية، بينما لم تقدم أطر أخرى أي فائدة أو حتى أدت أداءً أقل من نماذجها الأساسية. وأثرت النتائج أيضًا على استجابة المستخدمين بتقييم مدى توافق المحكمين الآليين مع تفضيلات البشر في التفكير البحثي. ومع أن المحكمين الحاليين من نماذج اللغات الكبيرة لا يستطيعون تمثيل التفضيلات البشرية بدقة عالية، فقد حقق أفضلهم نسبة دقة تبلغ 72.56% في تقييم الجودة العامة.

لمن يرغب في استكشاف الكود والبيانات وقوائم التصنيف، يمكنكم زيارة GitHub الخاص بالمشروع.