في السنوات الأخيرة، حقق مجال توليد الصور من النصوص (Text-to-Image Generation) تقدماً ملحوظاً، إلا أن معظم الأبحاث كانت تركز على إعدادات اللغة الإنجليزية، مما أدى إلى وجود فجوات في الأداء عبر اللغات المختلفة وتأثيرات خاصة بكل لغة لم يتم استكشافها بشكل كافٍ. في إطار سد هذه الفجوات، تم تقديم benchmark جديد باسم **LingT2I**، والذي يغطي عشر لغات شهيرة ويحتوي على 33,000 نموذج نصي. يهدف هذا المرصد إلى تقييم تأثيرات اللغات المختلفة في كل من توليد المحتوى ورسم النصوص.
استناداً إلى هذا المرصد، تم إجراء تحليل شامل للكشف عن عدم المساواة اللغوية والتنازلات المرتبطة بكل لغة عبر أبعاد التقييم المختلفة. وعلاوة على ذلك، فإن الدراسة تكشف عن مجموعة متنوعة من الأنماط المعتمدة على اللغة في عملية التوليد، مما يبرز كيف تؤثر العوامل اللغوية وسياقاتها الثقافية على النتائج الناتجة من النماذج. يمنح هذا benchmark والتحليل للباحثين أساساً لدراسة الأداء عبر اللغات في مجال توليد الصور من النصوص، ويساعد في تطوير نماذج أكثر قوة وشمولية. يتوفر الرمز والبيانات على GitHub.
تحديات كبيرة في دقة التوليد النصي للصور عبر اللغات المتعددة!
الكثير من التطورات شهدها مجال توليد الصور من النصوص، لكن البحث الجديد يبرز نقاط ضعف هامة في أداء النماذج عبر لغات متعددة. تعرفوا على benchmark LingT2I الجديد الذي يفتح الأفق لفهم الفجوات اللغوية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
