أعلنت الأبحاث الحديثة عن تقدم بارز في تقنية تحسين استدلال النماذج المتعددة الأبعاد من خلال مفهوم يُعرف بـ LEGO-OPD. هذه التقنية تجمع بين النماذج اللغوية الضخمة (LLM) ونماذج الرؤية البصرية (VLM) لتقديم إشراف تكاملي يعزز قدرات النماذج في الاستدلال البصري دون التأثير سلباً على قدراتها الفكرية.

تعد التحديات التي تواجه نماذج التعلم الآلي عادة معروفة، ومن أبرزها الصعوبة في فصل جودة الإشراف البصري عن القوائم اللغوية السابقة. الدرس المستفاد هو أنَّ زيادة قوة الإشراف البصري يمكن أن تعزز الإدراك ولكن قد تؤدي أيضاً إلى تدهور القدرة على الاستدلال اللغوي.

مع LEGO-OPD، تم تقديم حل مبتكر يعمل على دمج العوامل من خبير لغوي وآخر متخصص في الاستدلال البصري ضمن توزيع مدرّس واحد. من خلال صيغة بايزية عامة، يساهم الخبير اللغوي بسمات سابقة على الرموز المرشحة، بينما يساهم خبير الاستدلال البصري بإمكانية بصرية تحدث هذه السمة السابقة، مما يضمن أن المعلومات البصرية تنتقل بشكل مستقل.

أيضاً، تم إدخال عنصر المعايرة التكيفية لتحديد مدى قوة تحديث الإمكانية البصرية للسمة السابقة في كل ناحية من نواحي الشفافية. تجارب أجريت على نماذج Qwen3 أثبتت أن LEGO-OPD فاقت جميع الطرق السابقة في الأداء على مهام الاستدلال المتعددة الأبعاد والنصوص فقط. علاوة على ذلك، حسَّنت LEGO-OPD القدرة البصرية الأولية للطالب مع الحفاظ على جودة الاستدلال اللغوي فقط.

يمكن القول إن LEGO-OPD تفتح آفاقاً جديدة في معالجة المعلومات المتعددة الأبعاد، وهي تطور يستحق المتابعة الجديرة بالاهتمام في عالم الذكاء الاصطناعي.