في عالم الذكاء الاصطناعي المتطور، تبرز الحاجة إلى تطوير وكالات قادرة على التعامل مع التواصل غير المثالي بين البشر والآلات. يركز الباحثون الآن على مفهوم "محاذاة النية التفاعلية" (Interactive Intent Alignment)، وهو مفهوم يعكس واقع التفاعلات اليومية حيث لا يعبّر المستخدمون دائمًا عن نواياهم بوضوح.

في هذا الإطار، تم تقديم اختبار Drift-Bench++، الذي يوفر بنية تحتية شاملة لتقييم وكالات الذكاء الاصطناعي في الظروف الواقعية. هذا الاختبار يستخدم مجموعة من المهام القابلة للتنفيذ ويقيس قدرة الوكلاء على تحمل الضغوط الناتجة عن التواصل الغير مثالي وديناميكية الأهداف.

تم تصميم Drift-Bench++ بعناية لتضمين حالات من التواصل غير المتوافق وتغيرات النية، مما يمكّن الوكلاء من تحسين استجاباتهم والتكيف مع مشاريعهم المتغيرة. كما تم تطوير بروتوكول GRIP الشامل للتقييم والذي يغطي جوانب متعددة مثل واقعية المستخدم وفعالية الاستفسارات.

الدراسة تظهر أن التفاعل المحسن يساعد الوكلاء لكنه لا يزال بعيدًا عن الأداء المثالي الذي كان يتوقعه الباحثين. كما أن التجارب التي أجريت على جلسات ProdAgent أظهرت أن الفشل المصطنع الموجود كان شائعًا وله نتائج خطيرة في الأبعاد الحقيقية.

باختصار، توفر Drift-Bench++ أساسًا قويًا لتقييم وتطوير الوكالات بشكل مستدام، في حين تكشف عن القدرة الهائلة للتكيف مع نوايا المستخدم المتغيرة.