تُعتبر نماذج Diffusion-based large language (dLLMs) من الحلول المبهرة التي تساهم في التغلب على قيود الكفاءة الزمنية لوكلاء الذكاء الاصطناعي من خلال الاعتماد على فك الترميز الموازي. إلا أن التقييمات الأخيرة قد أظهرت وجود قضايا تتعلق بكفاءة الوكلاء المدعومين بهذه النماذج، حيث يستمر هؤلاء الوكلاء في الدخول في حلقات إعادة للتجريب، مما يعني أنهم يكررون الأفعال حتى بعد فشلها بفترة طويلة.

في هذا السياق، نقدم تحليلًا آليًا للخلل القائم، ونقترح حلاً يمكن تنفيذه دون الحاجة إلى التدريب. يُعزى سبب تكرار الأفعال الفاشلة إلى مرونة فك الترميز المقنع، حيث يقوم المليء (sampler) بتهيئة الخيارات الأكثر ثقة بينما يُفوض الخيارات غير المؤكدة. في حالة الفشل، يوفر السياق المُعطى احتمالًا مرتفعًا للقرار المؤجل، مما يؤدي إلى اتخاذ إجراء متكرر دون مواجهة حقيقة الفشل.

نظرًا لهذه الديناميكية، نبحث في كيفية تشويه توزيع الأفعال كنتيجة لعدم الوعي بالمهام (task-blind corruption). فالأفعال الظاهرة ضمن السياق (مثل الفعل الذي تم اتخاذه مؤخرًا) تُعطى احتمالية مضخمة تتعلق بالدولة والإجراء، دون أن تأخذ في الحسبان المهمة الأساسية.

نقوم بتحليل مقترح عدم التباين (invariance proposition): فإن عامل عدم التوعي بالمهمة يُلغي نفسه تمامًا من الاحتمالات العكسية لشرط (reverse conditional). يُمكن لنماذج masked dLLMs تقييم هذا الشرط العكسي بفعالية أفضل مقارنة بالنماذج autoregressive، مما يعطيها ميزة واضحة رغم الحاجة إلى بعض التجارب المتوازية لكل مرشح.

قمنا بتطبيق الخوارزمية الجديدة المسماة Reflect Reverse على أربعة مؤشرات قياسية متعددة التفاعلات، ووجدنا تحسنًا ملحوظًا في معدلات النجاح في المهام وتقدم العمليات مقارنة بأساليب التقييم التقليدية.