في عالم الذكاء الاصطناعي الحديث، تمثل عملية توليد النصوص والصور المتداخلة خطوة مهمة نحو تحقيق استفادة أكبر من نماذج اللغة متعددة الوسائط (MLLMs). هذه النماذج تقدم وسيلة أكثر حداثة لتوصيل المعلومات المعقدة بطرق بصرية جذابة. وبالرغم من أن الأساليب الحالية تعتمد على توليد الصور أو تعزيز الاسترجاع، إلا أنها غالباً ما تعالج المسارين كمسارات متعارضة، مما يفشل في دمج الحقائق مع الإبداع.

يقترح الباحثون خطوة جديدة في هذا المجال تُعرف باسم تخطيط أدوات ذكية (Agentic Tool Planning)، حيث يعمل النموذج كمتحكم مركزي يحدد بشكل مستقل متى وأين وأي الأدوات يجب استخدامها لإنتاج استجابات متداخلة لاستفسارات حساسة بصريًا.

ولتقييم هذا النهج بشكل منهجي، تم تقديم ATP-Bench، معيار جديد يتألف من 7,702 زوج سؤال-جواب (QA)، بما في ذلك 1,592 زوج من الأسئلة المرئية، موزعة على ثمانية فئات و25 نية حساسة بصريًا، مع استفسارات وحقائق تم التحقق منها بواسطة البشر.

كما تم تقديم نظام MAM (MLLM-as-a-Judge) لتقييم تخطيط الأدوات بشكل مستقل عن التنفيذ الشامل وتغيرات خلفيات الأدوات. يقوم هذا النظام بتقييم دقة استخدام الأدوات، ويحدد الفرص المفقودة لاستعمال الأدوات، ويقيم جودة الاستجابة الإجمالية دون الحاجة إلى مراجع حقائق.

أظهرت التجارب الواسعة على 10 نماذج MLLM متقدمة أن النماذج تواجه صعوبات في تخطيط متكامل ومتداخل، مما يكشف عن تفاوت كبير في سلوك استخدام الأدوات، ويعكس الفرص الكبيرة للتحسين.

للاستزادة حول هذا التطور المثير، يمكنكم زيارة [رابط_المقال] للحصول على مجموعة البيانات والكود المتاحة.

ما رأيكم في هذا التطور؟ شاركونا في التعليقات!