تشهد المجالات التقنية تطورات مذهلة، وخاصة في عالم الذكاء الاصطناعي (AI)، حيث تسعى الأنظمة الروبوتية العامة لتحقيق توازن بين التعميم الواسع والتنفيذ الدقيق للإجراءات. ولكن، تبقى هذه المعادلة معقدة، لا سيما بالنسبة لنماذج رؤية-لغة-فعل (Vision-Language-Action - VLA) المتاحة حالياً.

لقد تم تحسين نماذج رؤية-لغة الكبيرة (Large Vision-Language Models - VLMs) لتحسين التعميم الدلالي، ولكن يبقى جانب التفكير الملموس معوقاً للعديد من الأنظمة، حيث يؤدي انعدام التوازن بين العقلانية المعزولة ودرجة التحكم إلى تقلبات في الأداء.

لتقديم تقييم منفصل وكمّي لهذا التحدي، تم إدخال مقاييس جديدة تحت اسم "معدل الذكاء العقلاني الجسدي" (Embodied Reasoning Intelligence Quotient - ERIQ). تشمل هذه المقياس الجديد أكثر من 6000 مجموعة من أسئلة وأجوبة، موزعة على أربعة أبعاد تفكير.

لقد أظهرت الدراسات التي أُجريت أن هناك ارتباطاً إيجابياً قوياً بين القدرة على التفكير الجسدي وقدرة نظام VLA في تأدية المهام المعقدة. للوصول إلى تحديد العلاقة بين التفكير الدقيق والتنفيذ الفعلي للأفعال، تم اقتراح نموذج FACT، والذي يعتمد على مطابقة التدفق لتحويل التحكم المستمر إلى تسلسلات متقطعة ولكنها تحتفظ بجودة إعادة بناء المسارات.

وعن طريق دمج هذين المكونين، يقدم نموذج GenieReasoner تحسيناً كبيراً في أداء النظام مقارنة بالنماذج السابقة، حيث نجح في تخطي نماذج العمل المستمرة وتلك القابلة للتقطيع في مهام العالم الحقيقي. يتميز هذا التركيب بتقديم إطار عمل علمي لتشخيص ومعالجة مشكلة التوازن بين العقلانية والدقة في الروبوتات، مما يعزز قدراتها على التلاعب في البيئات المعقدة.

لمعرفة المزيد حول هذا التطور الرائع، يمكنك زيارة صفحة المشروع GenieReasoner.