في تطور جديد مثير في عالم الذكاء الاصطناعي، تم الكشف عن إطار تقييم مبتكر يُسمى PETSCAgent-Bench، والذي يهدف إلى تحسين عملية تقييم الشيفرات العلمية المُنتَجة بواسطة نماذج اللغة الكبيرة (Large Language Models) (LLMs). على الرغم من أن هذه النماذج قد أدت إلى تسريع生成 الشيفرات، إلا أن التقييم الشامل لجودتها لا يزال يمثل تحديًا كبيرًا.

تعتمد معظم المعايير الحالية على دقة الوظيفة أو إكمال المهام فقط، وهو أمر غير كافٍ عند العمل مع المكتبات عالية الأداء (HPC) التي تتطلب معرفة دقيقة بالاختيار بين الحلول (solver selection)، ومعايير API، وإدارة الذاكرة، والوعي بالتوازي، والأداء. لذلك، تم تصميم PETSCAgent-Bench كمعيار متعدد الأبعاد وإطار يعتمد على وكيل (agent-based framework)، لقياس ما إذا كانت الشيفرات العلمية المُنتَجة بواسطة الذكاء الاصطناعي تتوافق مع المعايير التي يستخدمها الخبراء.

هذا الإطار يستخدم مُقيّم مدعوم بالأدوات يقوم بتجميع الشيفرات وتنفيذها وقياس أدائها، حيث يجمع بين الفحوصات الحتمية (deterministic checks) والتقييمات المبنية على LLMs في سلسلة تتكون من 14 مُقيّماً تغطي خمس فئات: الدقة، الأداء، جودة الشيفرة، ملاءمة الخوارزميات، والمعايير الخاصة بالمكتبات.

من خلال تجارب فعلية على مشكلات PETSc، أثبتت النماذج الرائدة أنها تنتج شيفرات قابلة للقراءة ومنظمة جيدًا، لكنها تواجه صعوبة في الدقة عند التعامل مع المشكلات المعقدة، علاوة على تحديات تتعلق بالمعايير الخاصة بالمكتبات، حتى عندما يتم تجميع الشيفرات وتنفيذها بنجاح. هذه القيود لا تستطيع التقييمات التقليدية بالنجاح أو الفشل أن تلتقطها بشكل دقيق. ما هي آراؤكم حول هذا الإطار الجديد؟ وكيف تعتقدون أنه سيؤثر على مستقبل البرمجة العلمية؟ شاركونا في التعليقات!