في تطور مثير في مجال الذكاء الاصطناعي، تم تقديم معيار جديد يحمل اسم PACE-Bench (تكييف الفيزياء عبر تطور الكود) الذي يهدف إلى تحسين أداء الوكلاء الذاتيين (self-evolving agents) في ظروف متغيرة. يعتمد هذا المعيار على محاكاة تتكون من 144 زوجًا من التكيف، يتم ربط كل زوج بيئة مصدر بيئة مستهدفة متحوّلة، مع الحاجة إلى تحقيق الهدف نفسهِ والتفاعل عبر واجهة واحدة.
قد أظهر PACE-Bench نتائج مذهلة، حيث تم اختبار عشرة طرق مختلفة من النموذج الذاتي للتكيف عبر أربعة نماذج (paradigms). ومع ذلك، لا يزال المعيار بعيدًا عن الإشباع، حيث حقق نموذج Reflexion + Qwen3-14B نجاحًا بنسبة 35.9% فقط من الأزواج الكاملة في المعيار، بينما حقق GPT-5.5 نجاحًا أكبر حيث استطاع حل 66.7% من مجموعة Statics.
تشير النتائج إلى أن الاعتماد على التفكير المستند إلى المحاكاة يعد أكثر موثوقية من المراجعات الذاتية غير الموثقة، حيث تُظهر البيانات أن شجرة البحث الواسعة لا تؤدي دائمًا إلى التقارب، مما يسلط الضوء على أهمية إعادة تصميم الآليات بدلاً من مجرد الاستنتاج المقاييسي.
للمعنيين، يمكن العثور على البيانات والكود الخاص بـ PACE-Bench عبر رابط GitHub. هذا الإصدار فتح آفاق جديدة للبحث في كيفية تنمية الذكاء الاصطناعي ليكون أكثر استجابة للتغييرات المحيطة به.
PACE-Bench: ثورة مراجعة أداء الذكاء الاصطناعي في البيئات الديناميكية!
تقدم PACE-Bench معيارًا جديدًا لتقييم قدرة الوكلاء الذاتيين على التكيف مع التغيرات في البيئات الفيزيائية. النتائج تُظهر أن التصميم المستند إلى المحاكاة يتفوق على التعديلات الذاتية غير الموثقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
