في خطوة نوعية، أطلق باحثون مجموعة من الطرق الجديدة التي تهدف إلى قياس موثوقية نموذج "التفكير المتسلسل" (Chain-of-thought - CoT) في نماذج اللغة البصرية (Vision Language Models - VLMs). بينما يبدو أن عمليات التفكير المتسلسلة غالبًا ما تكون مُقنعة، قد لا تعكس دائمًا بدقة كيفية اتخاذ النموذج للقرارات.
تشير الأبحاث الأخيرة إلى أنه رغم وجود طرق متزايدة لقياس موثوقية نماذج CoT للنصوص، إلا أنه من الصعب تطبيق هذه الطرق على المدخلات البصرية. لذا، قام الباحثون بتكييف عائلة من الطرق النقدية المسماة "اختبارالابتكار" (Counterfactual Test - CT) و"اختبار الابتكار الترابطي" (Correlational Counterfactual Test - CCT) للاستخدام مع المدخلات البصرية، وأطلقوا عليهما اسم vCT وvCCT على التوالي.
تمت دراسة ثمانية نماذج VLM مجانية حديثة باستخدام vCT وvCCT على مجموعتين من البيانات. أظهرت التحليلات أن نماذج CoT لا تتبع الأدلة البصرية التي تؤثر على تنبؤات النموذج بشكل موثوق: فقد تتجاهل الزيادة عند حدوث تغيير كبير، بينما قد تذكرها عند حدوث تغيير بسيط.
أيضًا، وجدت الدراسة أن تفسيرات "التخمين ثم الشرح" (Predict-then-Explain) تتماشى بشكل أقوى مع التغيرات المحتملة في الاحتمال مقارنة بنماذج CoT التقليدية. كما أظهرت النتائج أن تدخل إزالة الكائنات يتسبب في تغييرات أكبر من تلك الناتجة عن إعادة البناء العادية.
وأخيرًا، قام الباحثون بإنشاء مجموعتين من البيانات: "Counter-SNLI-VE" و"Counter-A-OKVQA"، وهما مجموعتين من أزواج الصور التي تختلف بكائن واحد. هذه الخطوات تشير إلى تطور ملحوظ في فهم كيفية أداء نماذج اللغة البصرية.
اختبار الابتكار: قياس موثوقية نماذج اللغة البصرية باستخدام تقنيات جديدة!
نجح الباحثون في تطوير أساليب مبتكرة لتقييم مصداقية نموذج التفكير المتسلسل في نماذج اللغة البصرية. تكشف النتائج عن نتائج مثيرة حول كيفية تأثير التغييرات البصرية على دقة النموذج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
