تشهد تكنولوجيا مساعدات المحادثة تطوراً مستمراً، حيث يعمل المطورون على تحسين كيفية تفاعل هذه الأنظمة مع المستخدمين، خصوصاً فيما يتعلق بالصور. في أحدث الأبحاث، تم تناول كيفية تقديم اقتراحات لتحرير الصور لمساعدة المستخدمين على إكمال مهامهم بشكل أكثر فاعلية.

فقد أظهرت دراسة تم فيها جمع 100,000 عينة من المحادثات حول إنشاء الصور عبر تطبيق Qwen أن حوالي 80.1% من هذه المحادثات تعتمد على الصورة، مما يؤكد الحاجة الماسة لتوصيات متعددة الأنماط (Multimodal Recommendations).

لتلبية هذه الحاجة، تم تطوير إطار عمل من ثلاث مراحل. في المرحلة الأولى، تم استخدام بيانات حقيقية على الإنترنت لبناء جدول يتم مراجعته من قبل خبراء يتضمن نوايا تحرير متعلقة بالصور. ثم تم استخدام هذه النوايا لتوجيه عملية التدريب عبر أهداف التعلم الموجه (SFT).

في المرحلة الثانية، تمت مواءمة الاقتراحات المستندة إلى قواعد SFT مع اختيارات المستخدمين الفعلية عن طريق استخدام ملاحظات نقر المستخدمين لتحسين السياسة من خلال تعلم التعزيز متعدد الأهداف.

أما في المرحلة الثالثة، تم تقديم مدقق بصري (Visual Verifier) كإشراف إضافي على التدريب لتقليل التفاوتات المرئية بين التعديلات المقترحة والصورة الحالية.

أظهرت التجارب الشاملة أن هذا الإطار يتفوق بشكل كبير على النماذج السابقة، حيث تم تقليل التباين المرئي من 3.7% إلى 0.9%. كما تحسنت معدلات التفاعل مع الاقتراحات بنسبة 32.70%، وزادت نسبة استرداد الصور بنسبة 16.32%، وانخفض متوسط عدد المحادثات لكل مستخدم بنسبة 39.90%، مما يدل على فعالية هذا النظام الجديد.

هذه النتائج تمثل خطوة كبيرة نحو تحسين كيفية تفاعل المستخدمين مع مساعدات المحادثة، مما يجعل المهام المرتبطة بالصور أكثر سلاسة وفعالية.