في عالم الذكاء الاصطناعي، تتحول نماذج اللغة والرؤية (Vision-Language Models - VLMs) إلى بديل مُعتمد عن المحكمين البشر، مما يستدعي ضرورة تقييم فعاليتها بعيداً عن الظروف العرضية للتقييم. أظهرت دراسة جديدة اختبرت 200 جملة باللغة الإنجليزية تأثير الصور. هذه الدراسة، التي يُطلق عليها اختبار الصدمة المضللة (Misleading-Image Stress Test - MIST)، استخدمت جُملًا يمكن فهمها بعدة طرق، مع الصور المرتبطة بها.
تضمنت المواد المُستعملة في الدراسة صورة تُظهر الجملة بشكل صحيح، وصورة مُضللة تُظهر المعنى المعاكس، أو عدم وجود صورة على الإطلاق. كان على المحكمين اتخاذ قرار بناءً على الجملة وحدها، مما يضمن أن أي صورة لا يجب أن تؤثر على الإجابات. ومع ذلك، أظهرت النتائج المثيرة للاهتمام أن الصور كانت تؤثر بالفعل على أحكام المحكمين: حيث غيرت الصورة المرتبطة 20.5% من العلامات، بينما غيرت الصورة المُضللة 19.4%.
على الرغم من هذه التغييرات، أظهر التحليل أنه فقط 37% من العلامات التي اختلفت بين الصورتين اتجهت نحو المعنى الذي تم توضيحه، كما أن توافق المحكمين البشريين لم يتغير سواء كانت الصورة غائبة أو مرتبطة أو مضللة. لقد أظهرت النتائج أن ما يحرك المحكم هو وجود الصورة، وليس نوع الصورة، مما يعني أن تقييم الاستبدالية يعكس تكوينًا بقدر ما يعكس نموذجًا.
هذه الدراسة تطرح تساؤلات مثيرة حول كيفية اعتماد الذكاء الاصطناعي على العوامل البصرية في عملية التقييم، مما يفتح مجالات جديدة للبحث والدراسة في هذا المجال.
اختبار الصدمة: كيف تؤثر الصور المضللة على دقة نماذج اللغة والرؤية؟
كشف الباحثون في اختبار MIST النقاب عن تأثير الصور المضللة على دقة نماذج اللغة والرؤية (VLMs)، حيث أظهرت نتائج مدهشة حول كيفية تأثير الصور على قرارات المحكمين. دراسة تسلط الضوء على أهمية الظروف المتعلقة بالتقييم في نماذج الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
