في عالم الذكاء الاصطناعي، تُعتبر نماذج اللغة البصرية (Vision Language Models - VLMs) من أبرز الابتكارات التي دمجت بين الرؤية واللغة لتوفير فهم أعمق للبيئات المختلفة. وقد أظهرت الأبحاث الأخيرة أن هذه النماذج تمثل حالات عقلية مثل معتقدات الوكلاء ومعرفتهم ونواياهم. ومع ذلك، تبقى هناك تساؤلات حول كيفية استخدام هذه التمثيلات أثناء إجراء التنبؤات.
لتسليط الضوء على هذه القضية، ظهر نموذج Cross-Axis Routing Diagnostic (CARD)، الذي يوفر وسيلة مبتكرة لاختبار كيفية استجابة هذه النماذج لتوجيهات معينة. من خلال تمرير التنشيط على محور واحد وقياس استجابة محور آخر، يساعد هذا النموذج الباحثين في تقييم أداء نماذج اللغة البصرية.
قام الباحثون بتطبيق هذا النموذج على مجموعة بيانات جديدة تُعرف بـ Relay Chain، والتي تمثل اختباراً تعاونياً داخل بيئات شبكية. ومن خلال هذه الدراسة، اتضح أن هناك فشلاً حرجاً في توجيه المعلومات المتعلقة بالمعتقدات داخل نماذج VLMs، حيث يفشل النموذج في دمج هذه المعلومات عند التنبؤ بالإجراءات المستقبلية للوكلاء، مما يقود إلى فقدان معلومات قيمة حول شركاء الوكلاء.
هذا الاكتشاف الغني يفتح المجال لمزيد من البحث والتطوير في الذكاء الاصطناعي، مما يدفعنا لنسأل: كيف يمكن تحسين هذه النماذج للاستفادة من المعلومات المتاحة بشكل أفضل؟
اكتشاف أسرار نموذج CARD: كيف تعاني نماذج اللغة البصرية من فشل في تقدير الإيمان؟
تقدم دراسات جديدة نموذج CARD للكشف عن الفشل في توجيه الإيمان داخل نماذج اللغة البصرية. وبتطبيقه على بيانات جديدة، وجد الباحثون أن هذه النماذج تفشل في دمج المعلومات الحيوية حول إيمان الوكلاء، مما يؤثر على تنبؤاتها.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
