في عصر يتسارع فيه تطور الذكاء الاصطناعي، حققت نماذج توليد الصور من النصوص (text-to-image) طفرة ملحوظة في جودة الصور البصرية. لكن التحديات لا تزال قائمة، خاصة في تحسين هذه النماذج عبر ما يُعرف بالتدريب بعد النموذج (post-training). في هذا السياق، أطلق فريق من الباحثين أسلوبًا مبتكرًا يستند إلى دمج إشارات مكافأة متنوعة لتلبية كافة تفضيلات البشر.

المكونان الرئيسيان لنظام المكافآت القائم على هذا الأسلوب هما: أولاً مكافأة التفضيل، التي تم تدريبها على بيانات تفضيل بشرية واسعة النطاق باستخدام هدف برايدلي-تيري (Bradley-Terry) للحفاظ على تفضيلات جمالية وإدراكية شاملة، وثانيًا، المكافآت المستندة إلى الدرجات (rubric-based rewards) التي تقوم بتقييم مدى التوافق مع التعليمات المعطاة وخصائص أخرى مرغوبة، بينما توفر حماية ضد استغلال المكافآت.

تناول الباحثون أيضًا التحديات المرتبطة بدمج هذه الإشارات المتنوعة، حيث أظهرت النتائج أن الجمع البسيط عن طريق المعدل الوزني يؤدي إلى سلوك تحسين غير مثالي. ومن ثم، اقترحوا استراتيجية جديدة لموازنة التحسين وفقًا للتفضيلات مع رضا الدرجات.

الأداء الذي تحقق في سجل التفوق موديلية (Arena text-to-image leaderboard) يشير إلى نجاح التجربة، حيث حصل نموذج Flux2dev على تقييم إلو (Elo rating) يفوق 69 نقطة عن النموذج الأساسي، في حين تفوق نموذج Ideogram-4 على جميع النماذج مفتوحة المصدر الأخرى، وتجاوز تقييمه الـ 1223.5. هذه الأداءات تمثل إنجازًا كبيرًا في مجال الذكاء الاصطناعي، حيث تعكس نتائج الأبحاث الحاجة إلى مكافآت فعالة تغطي نطاقات واسعة من نوايا المستخدمين وتتحلى بالمتانة أمام الاستغلال خلال عملية التحسين.

لتعزيز البحث القابل للتكرار، أطلق الفريق مجموعة بيانات Arena-T2I-Training، وهي عينة مكونة من 1000 حالة تدريبية تستعيد بعض المنافع من التدريب الكامل، مما يمثل موردًا مهمًا يعزز الجهود المستقبلية في مجال التدريب بعد النموذج لنماذج النص إلى الصورة.