في عالم أبحاث المواد، تواجه وكالات الذكاء الاصطناعي تحديات حقيقية تتمثل في الوقت والموارد اللازمة لإجراء التجارب الحسابية. حيث تكرار نفس المحاكاة المكلفة عبر وكالات متعددة يمكن أن يجعل التقييم عملية غير عملية. لذا، يأتي هنا نظام CompMat-Bench، الذي يمثل معيارًا جديدًا يشتمل على 94 مهمة مستمدة من دراسات حديثة في علوم المواد.
يهدف CompMat-Bench إلى قياس أداء الوكالات في خطوات محددة نحو تحقيق الأهداف العلمية للمشاريع البحثية. وقد قامت الفرق البحثية بإعادة إنتاج خطوات البحث مسبقًا، مما يتيح تقييم الوكالات من خلال إمدادها بمدخلات وتحليل النتائج لمعادلات محاكاة مكلفة، لتفادي تلك التكاليف خلال التقييم.
يعتبر CompMat-Bench مبتكرًا بشكل خاص لأنه يوفر قاعدة للتقييم عبر أربعة شروط تقييمة: مهام فردية، وسير عمل من مهام ذات صلة، كل منها مع توجيه منهجي كامل أو مختصر. عندما يتم تقديم التوجيه الكامل لمهام فردية، أظهرت الوكالات المعتمدة على ثلاث نماذج لغوية ضخمة (Large Language Models) القدرة على إتمام خطوات البحث، حيث تراوحت معدلات النجاح بين 66.0% و90.4% عبر 94 مهمة.
ومع ذلك، تؤثر السير العمل الأطول والتوجيه المختصر سلبًا على أداء الوكالات بشكل مختلف، حيث ينخفض معدل نجاح الوكالات الأضعف، في حين أن الوكالة الأقوى تتعرض للاختبار فقط عند الجمع بين سير عمل طويل وتوجيه محدود. وتحلل نتائج الفشل وتظهر أن معظم الأخطاء تعود لأخطاء علمية بدلاً من أخطاء في استخدام البرمجيات.
إذاً، CompMat-Bench يوفر منصة مثيرة للاهتمام لإجراء مقارنة بين أداء الوكالات في خطوات أبحاث المواد، وهو يفتح آفاقًا جديدة لفهم ممارسات الفشل الخاصة بهم.
ثورة في علوم المواد: تقديم معيار CompMat-Bench لتقييم وكالات الذكاء الاصطناعي!
يقدم CompMat-Bench معيارًا جديدًا لتقييم وكالات الذكاء الاصطناعي في أبحاث المواد، حيث يتيح قياس الأداء في 94 مهمة مستمدة من دراسات حديثة. النظام يعتمد على خطوات بحث معادة الإنجاز لتجنب التكاليف العالية للتجارب المباشرة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
