في عالم الذكاء الاصطناعي، تمتلك نماذج اللغات الكبيرة (Large Language Models) القدرة على فهم الأسئلة البصرية بشكل مذهل. ومع ذلك، يواجه البعض صعوبة في تنفيذ مهام بسيطة قد تبدو بديهية، مثل تحديد الفرق بين صورتين مستشبهتين.
مع دخول VDiff-Bench إلى الساحة، تم تقديم معيار جديد يساعد في رصد الفروق الدقيقة بين الصور والذي يعد خطوة مهمة في هذا الاتجاه. يتضمن هذا المعيار 1756 سؤالًا متعدّد الخيارات حول أزواج من الصور، مُصنفة إلى 10 فئات مختلفة تشمل:
- الموضع
- الحركة
- لون الصورة الإقليمي
- اللون العام للصورة
- الظهور/الاختفاء
- الضجيج/الدقة
- الملمس
- الاستبدال/الحجم
- OCR/النص
- الإضاءة
كل سؤال يتطلب من النموذج تمييز الفرق الحقيقي عن خيارين صعبين ووصف "لا فرق" كخيار مضلل. وتأتي هذه الخطوة كتحدٍ لإجبار النماذج على التمييز بين التغيرات الفعلية والبدائل السيمانتية القريبة.
أظهرت التجارب التي أُجريت على 11 نموذجًا متطورًا من نماذج اللغات الكبيرة أن القدرة على المقارنة البصرية الدقيقة لا تزال هشة. هناك تفاوت في الأداء بين المصادر وفئات التغيير، حيث يعاني العديد من النماذج من عجز في التعامل مع التغيرات المنخفضة مثل الضجيج والملمس. على سبيل المثال، حققت بعض نماذج اللغات الكبيرة من السلسلة 7-8B نتائج تتراوح بين 52.5% و70.6% على التغيرات السيمانتية، لكنها بلغت فقط 8.7% إلى 33.3% في التغيرات الدقيقة مثل الضجيج والملمس.
وعلى الرغم من الأداء الجيد لبعض النماذج التجارية المغلقة، إلا أن نموذج Grok 4.3 عانى من انخفاض كبير في الأداء في التعرف على الفروق بين الصور، مما يعكس الحاجة الملحة لتحسين مثل هذه القدرات. بالمقابل، تبين أن بعض النماذج المفتوحة المصدر مثل Kimi K2.5 وK3 تتفوق بفارق ملحوظ.
بشكل عام، يوفر VDiff-Bench أداة تشخيصية متقدمة لتقييم الفهم المقارن البصري في نماذج اللغات الكبيرة، مما يكشف عن أوجه القصور التي قد لا تُلتقط من خلال مهام الرؤية واللغة التقليدية.
VDiff-Bench: تحدي جديد لاستكشاف الفرق بين الصور بدقة متناهية!
تم إطلاق VDiff-Bench، معيار جديد يهدف إلى تحسين قدرات نماذج اللغات الكبيرة في التعرف على الفروق بين الصور. يحتوي على 1756 سؤالًا تغطي 10 فئات من التغييرات، مما يعكس تحديات حقيقية في هذا المجال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
