في السنوات الأخيرة، شهدت نماذج اللغة متعددة الوسائط (MLLMs) انتشاراً واسعاً في مختلف المجالات، حيث تُستخدم كعملاء متعددين الخطوات تدعمهم قدرات التفكير الواضح لتنفيذ المهام. ولكن، على الرغم من فوائدها، إلا أن تراكم النصوص الذاتية يمكن أن يؤثر سلباً على الأداء العام، مما يُعرف بـ"دين النصوص".
من خلال مراقبة أداء هذه النماذج، وجد الباحثون أن التفكير يصبح متكرراً وغير مجدٍ بعد أن يتم تثبيت الأدلة المرئية ذات الصلة بالمهام. ولتجنب هذا، قدم الباحثون تقنية جديدة تُعرف باسم SPARE، والتي تعتمد على إطار عمل مُوجَّه بواسطة دالة Kullback–Leibler (KL) لإزالة النصوص الزائدة دون تأثير على الأدلة البصرية.
تعتمد SPARE على ملخصات حالة المهمة التي تُعتبر سياقاً تشخيصياً خاصاً، مما يُمكّن النموذج من اختبار ما إذا كان الملخص يغطي المقاطع المطلوبة بشكل كافٍ دون تشويش التفكير المستقبلي. والنتائج، التي تم تحقيقها على مجموعة من أدوات الاستخدام البصرية متعددة الخطوات، أظهرت تفوق SPARE في دقة الأداء رغم أنها قامت بإزالة ما بين 37.89% و64.58% من رموز التفكير.
هذا التوازن الرائع بين الدقة والسياق يؤكد أن تقليل الهيمنة النصية يُعيد الاعتماد على الأدلة المرئية، مما يُعزز أداء نماذج الذكاء الاصطناعي في مهام متعددة. لذا، كيف يمكن أن تؤثر هذه التقنية على مستقبل الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات!
تحرير النصوص في عالم الذكاء الاصطناعي: كيفية الحفاظ على الأدلة البصرية مع تقنيات متعددة الأبعاد
تقديم تقنية جديدة تُعرف باسم SPARE، تتيح نماذج اللغة متعددة الوسائط (MLLMs) تحسين أداءها من خلال تقليل النصوص المتراكمة مع الحفاظ على الأدلة البصرية الحيوية. هذه التقنية تظهر نتائج مذهلة في دقة نماذج الذكاء الاصطناعي خلال استخدام أدوات بصرية متعددة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
