شهدت نماذج توليد الصور من النص (Text-to-Image, T2I) تقدمًا ملحوظًا مما أدى إلى تدني أهمية المقاييس الآلية التقليدية التي تعتمد على مجموعات بيانات ثابتة. يدفع هذا الوضع الباحثين إلى البحث عن طرق جديدة لتقييم تقدم نماذج T2I.
نقدم لكم اليوم الإطار الجديد "تقييم النص إلى صورة متعدد الوسائط" (Multimodal Text-to-Image Eval, MT2IE) والذي يعد نقلة نوعية في هذا المجال. يعمل هذا الإطار من خلال نموذج لغوي كبير متعدد الوسائط (Multimodal Large Language Model, MLLM) حيث يقوم هذا النموذج بدور وكيل التقييم، حيث يقوم بتوليد المحفزات (prompts) اللازمة للتقييم وتقييم الصور الناتجة.
وفقًا للدراسات، تظهر درجات توافق الصورة والنص التي يوفرها MT2IE تطابقًا أكبر مع الأحكام البشرية بالمقارنة مع المقاييس التي تم تقديمها سابقًا في الأدبيات. يُظهر MT2IE كفاءة في توليد المحفزات التي تستكشف أداء نماذج تحويل النص إلى صورة بشكل دقيق، حيث يستعيد التصنيفات الرسمية لنماذج T2I من ثلاثة معايير مختلفة شكليًا باستخدام 20 محفزًا فقط، أي أقل بنسبة 28-105 مرة مقارنةً بمجموعات المحفزات الخاصة بالمعايير.
عند مقارنة تصنيفات نماذج T2I باستخدام المقاييس الحالية مثل CLIPScore وVIEScore وVQAScore، تبين أن تصنيفات MT2IE أكثر وفاءً وأكثر اتساقًا عبر عدة محاصيل تقييم مع استخدام نفس العدد من المحفزات. لقد تم تصميم MT2IE أيضًا ليكون قادرًا على تكييف التقييم حسب النموذج المعني، حيث يعيد كتابة كل محفز بناءً على أدائه المقاس ليُنتج معيارًا فريدًا لكل نموذج لا يزال يحافظ على التصنيفات الرسمية ويحتفظ بالنموذج المُقيَّم في مدى تقييم معلوماتي.
نتمنى أن تشجع هذه النتائج على تطوير أطر تقييم ديناميكية وتفاعلية، مما يُقلل من تدني أهمية المعايير الآلية التقليدية في تقييم النماذج الذكية. كيف تعتقد أن هذه التطورات ستؤثر على مستقبل تقنيات الذكاء الاصطناعي؟ شاركونا آرائكم!
نموذج تقييم الصور المعتمد على الذكاء الاصطناعي: ثورة في تقييم النماذج التوليدية
يقدم الباحثون إطارًا جديدًا لتقييم نماذج تحويل النص إلى صورة يعتمد على نماذج لغوية متعددة الوسائط. هذا الإطار يحقق نتائج أكثر توافقًا مع تقييمات البشر مقارنة بالمقاييس التقليدية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
