في ظل التقدم السريع الذي تشهده نماذج اللغة البصرية (VLMs)، يبقى تطوير المعايير والتقييمات متأخراً، مما يُصعّب عملية تحديد نقاط الضعف فيها. من بين التحديات التي تواجه الباحثين محاولة بناء اختبارات ضغط فعّالة، حيث يجب أن تلبي العينات مجموعة من الشروط المتحكم بها وتبقى قابلة للإجابة، بالإضافة إلى تحدي النماذج الحالية.
في هذا السياق، تم تقديم SABRE، وهو خط أنابيب آلي وقابل للتوسع، يُحوّل تصميم المهام (Test Primer) بصيغة Markdown والمُدرج معها مخطط البيانات، إلى مواصفات منظمة تشمل صوراً مُولَّدة أو معدلة، مع أزواج من الأسئلة والأجوبة. تعتمد SABRE على تصفية آلية تزيل المرشحين الذين تم حلهم بواسطة نموذج تصفية (Filtering VLM)، بينما يقوم المراجعون البشريون بالتأكد من صحة المرشحين وتصحيح التعليقات وإصلاح الصور محلياً.
تم تطوير SABRE-Prior لاختبار ما إذا كانت نماذج VLM تتبع الأدلة المرئية، بدلاً من الاعتماد على التوقعات المعروفة عن الأشياء والمشاهد المألوفة. يحتوي هذا الاختبار على 600 صورة و1000 سؤال، تتضمن مجالات السياق (الكيانات غير المتوقعة في المشاهد المألوفة)، والنسيج (المواد غير الحقيقية)، والصفات (أعداد غير تقليدية من المكونات)، واستنباط اللغة (إجابات مقترحة بواسطة اللغة ولكن غير مدعومة بالصورة).
تتراوح دقة المتوسط الصناعي عبر ستة نماذج من 17.8% إلى 31.3%، مع متوسط 22.6%. تتمتع الصور الحقيقية من نوع التحكم بالصفات بنفس مستوى الصعوبة بالنسبة لنموذج التصفية. كما تُظهر تجارب SABRE-Counting وSABRE-Spatial أن هذه الطريقة تدعم إعدادات اختبارات ضغط أخرى.
تؤكد هذه النتائج على أن SABRE يشكل إطاراً قابلاً لإعادة الاستخدام لبناء وتحديث اختبارات ضغط نماذج VLM بدلاً من أن تكون مجرد معيار ثابت واحد. لذا، تساهم SABRE في تعزيز دقة الاختبارات وكفاءة العملية البحثية في هذا المجال.
SABRE: الحل المتقدم لاختبار نماذج اللغة البصرية تحت الضغط
تقدم SABRE طريقة مبتكرة لاختبار نماذج اللغة البصرية (VLMs) من خلال استخدام تقييمات آلية وقابلة للتوسع. يهدف هذا النظام إلى تعزيز دقة الاختبارات وتحديد نقاط الضعف بطريقة فعالة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
