في عالم الذكاء الاصطناعي، كانت النماذج متعددة الوسائط (MLLMs) خطًا ثوريًا في دمج التفكير اللغوي مع إدراك المعلومات البصرية. إلا أن قدرتها على التخطيط المكاني وفقًا لقواعد محددة، سواء كانت معروفة أو غير مألوفة، لا تزال بحاجة إلى استكشاف أعمق. وهنا يتدخل مشروع RuleMaze، ليكون بمثابة نقطة تحول في هذه العملية.

يقدم RuleMaze معيارًا قابلًا للتحكم يتحدى هذه النماذج في التنقل عبر متاهات مع الالتزام بقواعد لغوية معقدة. من خلال هذا الاختبار، يتعين على النماذج فهم التخطيطات المكانية، تفسير التعليمات باللغة الطبيعية، والتخطيط لخطوات صحيحة وفقًا لذلك.

لرفع مستوى الأداء، تم تطوير تقنية جديدة تعرف باسم "Language-Logic-Function Hybridization"، والتي تعمل على إنشاء قواعد لغوية تلقائيًا وترجمتها إلى تمثيلات منطقية، مما يلغي الحاجة إلى الهندسة اليدوية للقواعد. إلى جانب ذلك، تم تقديم "Disentangled Multimodal Planning" (DMP)، والذي يعمل على فصل الإدراك والتنفيذ والتحقق من القواعد باستخدام وحدات تفكير واضحة.

تُظهر التجارب أن DMP يحقق تقدمًا ملحوظًا في الامتثال للقواعد ونجاح التخطيط مقارنة بأساليب التخطيط التقليدية، مما يؤكد أن RuleMaze هو الأداة المثالية لفهم التخطيط المكاني القائم على القواعد بأسلوب جذاب وشفاف. للحصول على الكود، يمكنكم زيارة GitHub.