في عالم التكنولوجيا المتقدمة، يُعتبر التفاعل بين الرؤية واللغة أحد النقاط المحورية لتحسين أداء أنظمة الذكاء الاصطناعي. هنا يأتي دور BUZZY، وهو ابتكار جديد في مجال الـ السؤال والإجابة متعددة الخيارات متعددة الوسائط (MCQA)، الذي أثبت فعاليته في تقليل التحيزات النصية التي قد تؤثر سلباً على نتائج الإجابات.

تتناول BUZZY مشكلة هامة، حيث تشمل نماذج السؤال والإجابة متعددة الخيارات على خيارات مرشحة قد تؤدي إلى ظهور انحيازات غير مقصودة. ورغم أن العديد من الأبحاث السابقة ركزت على الانحيازات الهيكلية، لكننا نعتقد أن الخيارات تعمل كأدلة نصية تؤثر على نماذج الرؤية واللغة (VLMs) لتفضيل الخيارات التي تبدو لغوياً معقولة، بغض النظر عن المحتوى البصري المرتبط.

تستند فرضيتنا إلى أن النموذج يعتمد على الأدلة البصرية بشكل حقيقي عندما يختلف توزيع الوسائط المتعددة بشكل كبير عن توزيع النص فقط. وبذلك، قدمنا BUZZY، وهي طريقة تقوم على إجراء تغيير دون تدريب، تعمل على تصحيح التنبؤات المتعددة الوسائط من خلال طرح توزيع النص فقط.

أثبتت التجارب التي أُجريت على خمسة نماذج للغة والرؤية عبر خمسة معايير لاختبار MCQA أن BUZZY قد حققت أعلى دقة متوسطة مقارنة بأحدث الأساليب، مع تقليل زمن الاستدلال بأكثر من 28% مقارنة مع الطرق التقليدية. هذه النتائج تشير إلى أن تعزيز الإشارة البصرية من خلال معاقبة التفضيلات النصية غير الفعالة يعد مفتاحًا لفهم MCQA المتعدد الوسائط بكفاءة وموثوقية.

هل أنتم متحمسون لرؤية المزيد من الابتكارات في مجال الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات!