في عالم الذكاء الاصطناعي، يعد تحسين الصناديق السوداء (Black-box Optimization - BBO) أحد التحديات الكبيرة التي تواجه العديد من المجالات العلمية والهندسية، حيث تكون تقييمات الأهداف مكلفة ومحدودة. ومع ظهور نماذج اللغة الكبيرة (Large Language Models - LLM)، نستطيع الآن الاقتراب من هذا التحدي بصورة جديدة تجمع بين دلالات المهام، والأدوات التحليلية، وعمليات اتخاذ القرار المعتمدة على التغذية الراجعة.

في هذا السياق، تم تقديم معيار AgenticBBO-Bench، الذي يعد نقطة انطلاق جديدة لتقييم أداء نماذج BBO عبر عدة مجالات. يشمل هذا المعيار مجموعة متنوعة من المشاريع مثل تحسين المعلمات، وتنسيق البيانات، وتصميم الرقائق، وتصميم الجزيئات، وذلك ضمن بروتوكول تقييم موحد يراعي الميزانية المحدودة. يُظهر هذا المعيار قوة ومرونة نماذج BBO، حيث سجلت في اختباراتنا نتائج متوسطة أعلى من أساليب LLM المباشرة في جميع المجالات الخمسة، وتجاوزت أفضل أدوات التحسين العددي في أربعة منها.

كما استعرضت دراستنا ثلاثة عوامل تؤثر في أداء الوكلاء: أدوات التحسين، معلومات المهمة والمعرفة السابقة، ودور LLM أثناء البحث. توضح النتائج أن الأدوات العددية الإضافية لا تحسن الأداء دائماً، بينما تكون الدلالات العامة أكثر فائدة بالمقارنة مع المعرفة السابقة الأكثر خصوصية. والأهم من ذلك، يمكن لأدوات التحسين العددية معالجة المكاسب التي تحققها الوكلاء من المسارات البحثية التي وضعها.

ونحن نتطلع إلى المستقبل، تم تقديم تحدٍ جديد ضمن AgenticBBO-Bench يتكون من خمس مهام، حيث تم تقييم سبعة نماذج LLM تحت مظلة وكيل Codex. وتبين أن نماذج GPT-6 Astra وDeepSeek-V4.1-Flash تقع في طليعة الأداء والتكلفة بين النماذج التي تم تقييمها.

لمعرفة المزيد حول كيفية تأثير هذه التطورات على مستقبل مجال الذكاء الاصطناعي، يمكنكم زيارة [الرابط].