في عالم الذكاء الاصطناعي، تعد استراتيجيات النجاح المتنوعة أمرًا بالغ الأهمية، وخاصة لوكلاء نماذج اللغات الضخمة (Large Language Models) الذين يُستخدمون في مهام اتخاذ القرار المتسلسل. ورغم أن هؤلاء الوكلاء غالبًا ما يخضعون لتدريب إضافي مع علامات نتائج قائمة على مسارات معينة، إلا أن هذه العلامات توفر إشرافًا ضئيلًا للحفاظ على تعدد الفروع الناجحة من نفس حالة القرار.

تسلط دراسة جديدة الضوء على هذه المشكلة من خلال مفهوم جديد يُعرف باسم "تغطية استراتيجيات النجاح"، والذي يهدف إلى تحقيق مدى شمولية نموذجي لتحقيق استراتيجيات ناجحة متنوعة ضمن ميزانية تنفيذ ثابتة. حيث تم تقديم طريقة جديدة تُعرف بـ "تحسين التنوع المباشر" (Direct Diversity Optimization - DDO)، والتي تمثل نهجًا لمرحلة ما بعد التدريب، حيث تجمع بين جمع شجرة التباين (Divergence-Tree Collection - DTC) وهدف نِسب الأهداف النسبية المرجعية (Reference-Relative Target-Odds Objective - RTO).

تقوم DTC ببناء مجموعات فروع متوافقة مع الحالة تستند إلى حالات القرار المشتركة، فيما يتدرب نموذج RTO لمطابقة الأهداف النسبية المرجعية عبر البدائل الناجحة. لقد أثبتت DDO أنها تحقق أعلى معدل نجاح في المهام وتحقيق تغطية متميزة للاستراتيجيات الناجحة مقارنة بأساليب ما بعد التدريب الأخرى عبر منصات متعددة مثل BabyAI وBabaIsAI وWebShop.

بالإضافة إلى ذلك، حققت هذه الطريقة أعلى معدل تعافي بعد استبدال الإجراءات المحلية، ونجاحًا أكبر في المهام وتنوعًا أفضل من الاستراتيجيات التي تعتمد فقط على المحاكاة الناجحة وعمليات تنويع الوقت لدى التشفير.

إن ما يميز DDO هو قدرتها على تحقيق توازن بين تعدد الاستراتيجيات ونجاح المهمة، مما يفتح آفاقًا جديدة لتطوير نماذج ذكية أكثر كفاءة وابتكارًا. ماذا تعتقدون في هذا النهج الجديد؟ شاركونا آراءكم في التعليقات.