في إطار التطورات المستمرة في مجالات الذكاء الاصطناعي، تم إطلاق معيار جديد يُدعى AMIGO، وهو اختصار لـ "Agentic Multi-Image Grounding Oracle Benchmark". يركز هذا المعيار على تقييم نماذج رؤية اللغة (Vision-Language Models) من خلال تفاعلات طويلة الأمد، بحيث تتجاوز القياسات التقليدية التي تعتمد على صورة واحدة.

يأتي AMIGO ليقدم طريقة مبتكرة لتحديد الأهداف المخفية من خلال مجموعة من الصور المرئية المتشابهة، حيث تتعامل النموذج مع عملية الاختيار عبر طرح سلسلة من الأسئلة ذات الطابع الاستكشافي، والتي يتم تقييمها بناءً على ردود محددة مثل نعم/لا/غير متأكد. ولتعزيز فعالية هذه العملية، يلتزم المعيار الخاص بالمشروع بتوفير عواقب لعدم الصواب أو الأسئلة غير الصائبة.

تتضمن الوظائف الأساسية للمعيار الجديد:
1. **اختيار الأسئلة تحت الظروف الغامضة:** مما يسمح للنموذج بالتكيف مع المعلومات المتاحة.
2. **تتبع القيود باستمرار:** مما يعزز قدرتها على فهم التحديات المتزايدة بشكل أفضل.
3. **التفريق الدقيق:** حيث يتم تحسين الأداء بشكل متزايد مع مرور الوقت.

تم تكريس معيار AMIGO لتطبيق "Guess My Preferred Dress"، وقد تم تقييم نماذج رؤية اللغة المفتوحة باستخدام مجموعة من المعايير، تشمل نجاح التعرف، والتحقق من الأدلة، والكفاءة، والامتثال للبروتوكولات.

أظهرت النتائج أن الاعتماد فقط على دقة الإجابة النهائية يمكن أن يبالغ في أداء النماذج، إذ يمكن أن تتوصل النماذج إلى استنتاجات صحيحة دون التحقق من الأدلة اللازمة، أو تفشل في الحفاظ على البروتوكولات الملائمة. للحصول على أداء قوي، يجب على النموذج تحقيق مزيج من دقة الرؤية، واختيار الأسئلة المفيدة، وتعقب القيود بكفاءة، والقدرة على تجاوز المنافسات.

إن إطلاق AMIGO يمثل علامة فارقة في تقييم تفاعل النماذج الذكية، حيث يقدم نهجاً شاملاً يركز على تفاعل طويل الأمد وتقييمات دقيقة. ما رأيكم في هذا التطور الجديد؟ شاركونا في التعليقات!