في عالم الذكاء الاصطناعي، تتجه الأنظار نحو تطوير نماذج التخطيط البصري المعتمدة على النماذج اللغوية المرئية (Vision-Language Models - VLMs). ومع ظهور الأبحاث الجديدة، يتجلى لنا مشروع "ViPlan" كأول معيار مفتوح المصدر يهدف إلى مقارنة طرق التخطيط الرمزي المعتمدة على هذه النماذج.

تتميز ViPlan بتقديم مجموعة من المهام التحديّة المتزايدة في نطاقين بصريين مختلفين: مشكلة التخطيط في Blocksworld الكلاسيكية وبيئة الروبوتات المنزلية المحاكاة. من خلال هذه المهام، وجد الباحثون أن الطرق المعتمدة على الرموز (VLM-as-grounders) تتفوق على التخطيط المباشر باستخدام VLMs في مهام Blocksworld (حل 46% من المهام مقابل 9%). ولكن في السياقات الخاصة بالروبوتات المنزلية التي تعتمد على المعرفة اللغوية، تتجاوز أساليب التخطيط المباشر (VLM-as-planner) بشكل كبير تلك المعتمدة على الرموز، حيث حققت حل 34% من المهام مقابل 5% فقط.

تسلط هذه النتائج الضوء على نقاط الضعف الجوهرية في كل من أسلوب التخطيط الرمزي والأسلوب التقليدي، مما يفتح المجال لفهم أفضل وتحليل كيف يمكن تحسين قدرات التخطيط البصري. كما أظهرت الأبحاث عدم وجود فائدة ثابتة من محفزات Chain-of-Thought، مما يشير إلى قيود مستمرة في قدرات الاستدلال البصري للنماذج اللغوية المرئية الحالية.

ما رأيكم في هذا التطور؟ شاركونا في التعليقات.