لقد حققت نماذج اللغات متعددة الأبعاد (Multimodal Large Language Models - MLLMs) نجاحًا ملحوظًا في مهام التفكير البصري، إلا أنها لا تزال تواجه تحديات تتمثل في الاعتماد الزائد على المعطيات اللغوية وتوليد إجابات قد تفتقر للدلالة البصرية الضرورية. فقد أظهرت الدراسات السابقة أن تعزيز التفكير يستند عادة إلى استراتيجيات التوجيه أثناء عمليات الاستدلال أو الإشراف المتعلق بالتفكير.
الآن، في إطار بحث حديث، تم تسليط الضوء على سؤال مختلف: هل يمكن تحسين التفكير المتعدد الأبعاد بزيادة الترابط الضمني مع العناصر البصرية دون الإشراف المباشر على عملية التفكير؟ من خلال دراسة التخصص الوظيفي لرؤوس الانتباه (Attention Heads)، تم التحقق من إمكانية تحسين التفكير عن طريق توجيه تلك الرؤوس الأكثر استجابة للأدلة البصرية.
المقاربة الجديدة تحت مسمى "تركيز الكتلة الاحتمالية الانتقائية" (Selective Probability Mass Concentration - sPMC) تقدم إطار عمل يفيد في تحديد الرؤوس المستجيبة لأسس البصرية، ويقوم بتعديل الانتباه بين النص والصورة بشكل انتقائي. يعتبر هذا الأسلوب انتباهًا مُنظَّمًا يشجع على تخصيص الكتلة الاحتمالية لمناطق ذات دلالة سيميائية باستخدام أولويات مكانية مستمدة من تقسيمات بصرية.
تسمح "اختيار الرؤوس المتكيّف" (Adaptive Head Selection) بتقييد هذا التوجيه على الرؤوس المستجيبة بصريًا، مع الاحتفاظ بوظائف الرؤوس الأخرى مستمرة.
كانت النتيجة رائعة حيث أن sPMC حقق زيادة في الأداء بنسبة 3% كمتوسط، مع زيادات تصل إلى 11.3% عبر 6 مجموعات معايير متعددة الأبعاد، وذلك بينما تمت مراجعة 3%-15% فقط من رؤوس الانتباه. كل هذه النتائج تؤكد أن توجيه أدلة بصرية ضئيلة ومعدلة يمكن أن يعزز مباشرةً من قوة التفكير المتعدد الأبعاد.
كيفية تعزيز التفكير المتعدد الأبعاد: استراتيجية مثبتة لتحسين أداء نماذج الذكاء الاصطناعي
تمتاز نماذج اللغات متعددة الأبعاد (MLLMs) بأداء قوي في مهام التفكير البصري، لكن هل يمكن تحسين هذا الأداء من خلال تقنيات جديدة؟ دراسة حديثة تقدم إطار عمل مبتكر لتحسين الربط بين النصوص والصور، مما يعزز دقة الاستدلال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
