أعلنت مجموعة من الباحثين عن إطلاق مشروع FindStatBench، وهو معيار جديد لتقييم النماذج اللغوية الضخمة (Large Language Models) في مهام توليد الشيفرات التوافقية. يحتوي هذا المعيار على أكثر من 2329 مهمة موزعة على 24 مجموعة، حيث يتضمن 5.52 مليون حالة مخفية. يركز FindStatBench على توليد الإحصائيات، وهي مهمة تعني تحويل الأجسام إلى أرقام، وكذلك توليد الخرائط التي تعني تحويل الأجسام إلى أجسام.
كل مهمة تحتوي على وصف رياضي، وحتى خمسة أمثلة من المدخلات والمخرجات العامة. المطلوب من النموذج هو إنتاج دالة حل بلغة بايثون بدون استرجاع أو استخدام أدوات أو تلقي تعليقات، مما يجعل هذا المعيار يبرز التحليل الدقيق لأداء النماذج.
تم تقييم أحد عشر نظامًا، بما في ذلك أربع نماذج مغلقة المصدر وسبع نماذج مفتوحة تم تقديمها عبر موفر واحد للاستدلال. وقد أظهر FindStatBench ثلاثة أنماط رئيسية: أولاً، كان الأداء بين أقوى النماذج المفتوحة والمغلقة متقارباً ضمن نسبة دقة واحدة، مع تحقيق مكاسب دقيقة محدودة عند استخدام النماذج المتوسطة كمرجعية.
ثانيًا، قد تؤثر الأمثلة سلباً على النتائج: حيث تمكّن بعض التباديل الكلاسيكية من الحل بدقة دون أمثلة ولكنها عانت تحت ضغط الخمسة أمثلة. ثالثًا، عكست بعض الإخفاقات آليات ميزانية المخرجات، حيث يمكن أن تستهلك عمليات التفكير الاستجابة المرئية قبل إنتاج الكود.
بشكل عام، تمثل توليدات الإحصائيات مهمة أسهل بكثير من توليدات الخرائط، بينما تبين أن بعض المجموعات لا تحقق فارقًا كبيرًا في الدقة. لذا، يعد FindStatBench أداة قيّمة لفهم كيف تتفاعل نماذج اللغة مع المهام المعقدة وكيف يتم تحسينها في المستقبل.
اكتشاف FindStatBench: معيار جديد لتقييم نماذج اللغة في توليد الشيفرة!
تم إطلاق FindStatBench كمعيار جديد لتقييم نماذج اللغة الكبيرة في توليد الشيفرات التوافقية. بمحتوى غني وبيانات متنوعة، يقدم معيار FindStatBench رؤية جديدة حول أداء هذه النماذج في مهام معقدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
