تزايدت التطورات في مجال الذكاء الاصطناعي، إلا أن نماذج الرؤية واللغة (Vision-Language Models) لا تزال تواجه صعوبات جوهرية، وهي قدرة الربط المركب. هذا يعني أن الخوارزميات الحالية قد تفشل في ربط السمات بالكائنات أو العلاقات بالإشارات المناسبة. والمشكلة تكمن في أن الاختبارات الحالية غالبًا ما تعتمد على صور حقيقية لا تتيح تقييمًا دقيقًا بسبب التأثيرات البصرية المختلفة.

تقديم Auto-Comp يعد خطوة ثورية نحو تحسين تلك النماذج. تعتمد هذه الأداة على مناهج مبتكرة لإنتاج معايير صورة واقعية وبشكل آلي. تتمثل خبرتها الرئيسية في تقنية A/B الموازية، حيث تُنتج الأداة لكل مفهوم نموذجًا بسيطًا وعينة سياقية تضيف تعقيدًا بصريًا.

تستعرض Auto-Comp أربعة مجالات عمل تتمحور حول الربط المركب: لون، شكل-لون، موضع، والحجم النسبي. تم تقييم أكثر من 25 نموذجًا مختلفًا ضمن هذه المنصة، مثل CLIP وSigLIP.

وجدت الدراسات أن هناك فجوة كبيرة بين ما يُسمى بSwap-vs-Confusion، حيث تكشف الكائنات ذات تباين منخفض عن عيوب تتجاوز قيودات النماذج المعتمدة على الكلمات. كما تشير النتائج إلى وجود توازن معتمد على المهمة؛ حيث يمكن أن يساعد السياق البصري في تحسين العلاقات ولكنه قد يعوق ربط السمات بسبب الفوضى البصرية.

تتطلع Auto-Comp إلى تحسين فهمنا للنماذج من خلال توفير أدوات تقييم محسّنة وبيانات جديدة، مما يعد بآفاق مشرقة لمستقبل الذكاء الاصطناعي.