في السنوات الأخيرة، انتشرت نماذج الرؤية-اللغة (Vision-Language Models - VLMs) كأدوات واعدة في مجال التعرف على الوجوه، إذ تتميز بإمكانية إنتاج شروحات باللغة الطبيعية جنباً إلى جنب مع درجات التشابه. هذه الميزة تُعتبر جذابة بشكل خاص في سياقات الطب الشرعي، حيث تتطلب القرارات أن تكون شفافة وقابلة للتدقيق.
ومع ذلك، فإن التقييمات الحالية لنماذج VLMs تركز بشكل رئيسي على دقة التعرف، بينما تظل صحة الشروحات المُنتجة غير مُقاسة. لذلك، تم تقديم إطار عمل جديد لتقييم التعرف على الوجوه المعتمد على نماذج VLM والذي يعالج جودة الشرح كعنصر أساسي في التقييم.
يقدم هذا العمل معيارين أساسيين يجب أن تمتثل لهما الشروحات:
1. **الملاءمة**: الاعتماد على ميزات الوجه الثابتة التي تدل على الهوية.
2. **الأمانة**: التوافق مع محتوى الصورة المرئية دون ميزات مُخترعة.
لقد قمنا بتطوير منهجية تمكّن من قياس الملاءمة والأمانة للنماذج المُقيمة، بناءً على تحديد مخرجات النموذج إلى تنسيق شرح منظم يدعم الاستعلام الآلي والتدقيق.
بفضل هذا الإطار، قمنا بتقييم عدة عائلات من نماذج VLMs ذات الوزن المفتوح، مع فحص دقة التحقق من الوجه وجودة الشروح. وقد أظهرت النتائج أوجه القصور المتبقية في الشرح المُنتج، مما يؤكد على الحاجة إلى مقاييس جودة الشرح لرسم صورة كاملة عن أداء النموذج.
هذا الإطار المتقدم والمزود بتقييم مفتوح المصدر يوفر أساساً قوياً لتقييم نماذج التعرف على الوجوه القابلة للتفسير وتحسين أدائها في المستقبل.
تقييم جودة الشرح لنماذج الرؤية-اللغة المفتوحة في التعرف على الوجوه: هل نكون أمام ثورة جديدة؟
تقدم نماذج الرؤية-اللغة المفتوحة أدوات واعدة في التعرف على الوجوه، لكن تقييم الأجوبة المولدة لم يُحسب بعد. كيف يمكننا قياس جودة هذه الشروحات؟
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
