في عالم الذكاء الاصطناعي، يتطور المجال بسرعة وبشكل متكرر. مؤخرًا، تم تسليط الضوء على مفهوم جديد يُعرف بالممارسة الذاتية المتميزة (Privileged Self-Practice) والذي يعد بزيادة فعالية الوكلاء في المهام متعددة الأدوار.

تعتبر تقنية الاستخلاص الذاتي على السياسة (On-policy self-distillation) شائعة لدى الوكلاء المدعومين بنماذج اللغة الضخمة (Large Language Models). إذ تُشرف تلك التقنية على نماذج الوكالات في المستوى الرمزي، مستفيدة من معلومات حصرية (Privileged Information) تعزز من أداء النموذج. إلا أن الأبحاث الجديدة أظهرت أن هذا النموذج، رغم أنه يبدو وكأنه يمتلك معلومات حصرية، ينقصه المعرفة الحقيقية وراء هذه المعلومات، مما يؤدي إلى أداء أقل مما هو متوقع.

بناءً على هذه التحديات، وفق مجموعة من الباحثين، تم تقديم نموذج الممارسة الذاتية المتميزة (PSP) الذي يقوم على نقل المعلومات الحصرية من الاستخدام في فقدان النموذج إلى نمط أخذ العينة. هنا، عندما يواجه النموذج فشلًا في تنفيذ المهام، يُدخل نموذج تحليل قصير يساعده في إعادة تقييم السياق وإعادة المحاولة، مما يساهم في تحسين أدائه بشكل ملحوظ.

أظهرت النتائج عبر منصتي AppWorld وSWE-bench Verified أن PSP أظهر تحسنًا في الأداء بشكل كبير، متفوقًا على النسخ العادية من GRPO بنسبة تصل إلى 65% في إنجاز الأهداف و61% في نسبة الحل على SWE-bench Verified. إن هذه النتائج تعكس الإمكانيات الكبيرة لمقاربة الممارسة الذاتية المتميزة في تحسين أداء الوكلاء، مما يبشر بأفق جديد في تحسين تطبيقات الذكاء الاصطناعي.

ما رأيكم في هذا التطور الجديد؟ شاركونا في التعليقات!