في عالم الذكاء الاصطناعي، يعد التعلم في السياق (In-Context Learning - ICL) من الأساليب المستخدمة على نطاق واسع في النماذج اللغوية العملاقة متعددة الوسائط (Multimodal Large Language Models - MLLMs) والتي حققت أداءً متميزًا في مجموعة متنوعة من المهام. ولكن، هل تعلم أن العديد من الطرق المستخدمة حاليًا تعتمد فقط على تقليد السطح؟ وهذا يعني أن النماذج تجد صعوبة في محاذاة استجابتها مع مسارات التفكير المطلوبة للمدخلات متعددة الوسائط المعطاة.

لتجاوز هذه المعضلة، تم اقتراح إطار جديد يجمع بين نمذجة العرض التوضيحي بطريقة متباينة وقدرة النماذج على التحسين الذاتي. يقوم هذا الإطار بإعادة صياغة كل عرض توضيحي من خلال المقارنة الصريحة بين استجابة غير مثالية وأخرى أفضل تحت نفس المدخل، مما يساعد على توضيح مسار التفكير الذي يجب اتباعه لتحسين الاستجابة.

جاءت النتائج التجريبية على ثلاثة أنواع من المهام متعددة الوسائط لتظهر أن هذا الإطار الجديد يساهم بشكل مستمر في تعزيز أداء النماذج، مع تحقيق تحسينات ملحوظة في حل أسئلة الصور (Visual Question Answering - VQA). هل أنت مستعد لمعرفة المزيد عن هذه التقنية المتطورة وكيف يمكن أن تغير عالم الذكاء الاصطناعي؟