في عالم الذكاء الاصطناعي، حيث تتسارع نماذج اللغات الكبيرة (MLLMs) بوتيرة مذهلة، تبقى عملية تطوير المعايير التقليدية خلف الركب، مما يعوق دراسة الفجوات الجديدة في القدرات.

تعتمد هذه الدراسات على تنسيق مهام معبر وعملية بناء تستند إلى الطلب. هنا تبرز أهمية الرسوم البيانية الغنية بالمعلومات، حيث تعتبر قادرة على اختبار دمج الإدراك والتفكير الأساسي في مجال إجابات الرسوم البيانية (Chart QA).

أُدخلت تقنية ChartBmkAgent الجديدة إلى الساحة، وتهدف إلى تسريع دورة تطوير المعايير من خلال تحويل الفجوات المحددة إلى عينات مستهدفة بناءً على الطلب. حاليًا، تفصل الأساليب المستخدمة عادةً بين توجيه الأهداف وتوليد المحتوى من الصفر، مما يعيق دقة الفحوصات. ونظرًا لأن الأنظمة الموجهة تحتاج غالبًا إلى بيانات أو رسوم بيانية معدة مسبقًا، فإن الأنظمة التي تعتمد على توليد المحتوى من الصفر لا تحقق دائمًا التوافق بين المتطلبات المحددة والأهداف التشخيصية.

تتولى تقنية ChartBmkAgent هذه المهمة، حيث تحول فجوة القدرة المحددة إلى إثبات تشخيصي مستهدف، من خلال بناء عينات كاملة من Chart QA انطلاقًا من مواصفات أخطاء مختزلة. يتولاها حزمة مركزية تدير وكلاء متخصصين، وتحتاج إلى دليل محدد على التوافق مع فئة الخطأ الأصلية، وتوثق أساس كل قرار قبول.

عند تقييم 300 عينة شاملة، تراوحت دقة نماذج MLLM ما بين 32.7% إلى 84.3%، مما يعكس اختلافات ملحوظة في القدرة. وفي إجراء مقارنات متعددة بين ثلاثة نماذج، سجلت النتائج المستهدفة 50.0% مقارنة بـ82.2% على القياسات المتطابقة. كما أثبتت جميع المقارنات عبر النماذج الستة نفس الاتجاه، مما يدل على قيمة هذه التقنية في التحقق المستهدف وتوليد بيانات تشخيصية.

في اختبارات أخرى، تم تقييم ما إذا كانت كل عينة قد اختبرت فئة الخطأ المحددة، حيث أفادت 86.4% من النتائج بتحقيق هذا المعيار، موفرةً دليلاً تجريبيًا على الحفاظ على الأهداف.

إن ChartBmkAgent تمثل خطوة كبيرة نحو تحسين دقة اختبارات الذكاء الاصطناعي وتقصير الوقت اللازم لتطوير المعايير. ما رأيكم في هذا التطور الرائع في عالم الذكاء الاصطناعي؟ شاركونا في التعليقات!