في عالم الذكاء الاصطناعي، تمثل النماذج العالمية للعمل (World Action Models - WAMs) حجر الزاوية في تحديد كيفية تصرف الروبوتات في المستقبل المتوقع. ومع ذلك، فإن الزيادة في زمن التنفيذ نتيجة للاعتماد على تكرار الفيديو تؤخر عمليات النشر بشكل كبير. في هذا السياق، يطرح الباحثون سؤالًا عميقًا: هل يحتاج توليد الأفعال حقًا إلى المسار التطوري المتكرر، أم يكفي تمثيل المستقبل فقط؟
عبر أربعة نماذج من WAMs تم تقييمها على 40 مهمة من LIBERO، تبين أن التدخلات المتكررة بالحلقة المغلقة تكشف عن حساسية شديدة للقيم المستقبلية ومواقعها المعينة. بالنسبة لنماذج Joint وCosmos-2، تبين أن استخدام ذاكرة ثابتة واحدة فقط للحفظ تكاد تحافظ على أداء التنفيذ دون تعديل، حيث بلغ متوسط انحراف النهاية 1.7 إلى 1.9 سم مع نسب نجاح مدهشة تتراوح بين 97.9% و98.2%.
لكن الفكرة الحقيقية تكمن في نموذج RIFT (تخيل خالٍ من التكرار عبر الرموز المستقبلية) الذي يستخدم الرموز التي تُنتج خلال مرحلة التعلم لبناء ذاكرة مستقبلية كاملة في تمريرة واحدة فقط، مع الحفاظ على واجهة قراءة المستقبل الأصلية.
على منصة LIBERO، حقق نموذج RIFT نجاحًا بنسبة 98.8%، وهذا قريب جدًا من النماذج المعتمدة على تكرار مثل Joint وIDM وLingBot-VA التي حققت نسب نجاح من 98.4% إلى 98.6%. بالإضافة إلى ذلك، تم تقليل زمن التأخير في توليد الإجراءات بنسبة تتراوح من 68.2% إلى 89.1%.
تظهر النتائج النهائية على RoboTwin 2.0 أن RIFT حقق نسب نجاح بلغت 92.9% و92.6% في المشاهد النظيفة والعشوائية، وهو ما يُعتبر الأفضل بين الطرق المُقيمة. تعزز هذه النتائج إمكانية تنفيذ تقنيات الذكاء الاصطناعي دون الحاجة إلى توليد الفيديو بشكل تكراري عند نشرها. في عالم يتسارع فيه التقدم التقني، يبدو أن RIFT هو خطوة نحو المستقبل.
رؤية المستقبل بدون تعقيدات: نموذج RIFT لتقنيات الذكاء الاصطناعي في التحركات العالمية
يقدم البحث نموذج RIFT الذي يعد بتقليل تأخير تنفيذ الروبوتات عبر تحسين استخدام الذاكرة المستقبلية. نتائج واعدة تعزز إمكانية تنفيذ مهام متعددة بكفاءة عالية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
