في الآونة الأخيرة، أصبحت نماذج اللغة الكبيرة المنتشرة (dLLMs) محور اهتمام كبير بسبب قدرتها على تعزيز التنوع والتحكم والتماثل. ومع ذلك، فإن عملية إنشائها غير المتسلسلة وإخفاء الاتجاه الثنائي يجعل من الصعب تقييم الجودة بشكل فعال، مما يسلط الضوء على الحاجة إلى تقييم ذاتي موثوق.

لذا، نقدم لكم نموذج DiSE، والذي يعد طريقة بسيطة لكنها فعالة لتحديد الثقة في التقييم الذاتي لنماذج dLLMs. يعتمد نموذج DiSE على حساب احتمالية تجديد الرموز في التسلسل الناتج بالكامل، بالاستناد إلى السياق الكامل. هذه الطريقة لا تمكن فقط من تقييم الجودة بطريقة أكثر كفاءة، بل تُعزز أيضًا تقديرات الاحتمالات الكاملة وتساعد في تقليل الشكوك.

إضافة إلى نموذج DiSE، نقدم إطار توليد بطول متكيف، الذي يضبط طول التسلسل بناءً على تقييم النموذج لنتائجها الخاصة. هذا يجعل التقييم أكثر مرونة وفعالية. وقد قمنا بتحليل و验证 feasibility لموديل DiSE من وجهة نظر تعميم dLLM، حيث أظهرت التجارب التجريبية ارتباطًا إيجابيًا بين DiSE وكل من التماسك الدلالي ودقة الإجابات.

تؤكد التجارب الواسعة التي أُجريت على تقييم الاحتمالات وتقليل الشكوك وتوليد الطول المتكيف على فعالية DiSE، مما يمهد الطريق لحلول تقييم جودة أكثر ابتكارًا في مجال الذكاء الاصطناعي. للمزيد من التفاصيل، يمكن زيارة صفحة المشروع.