LayerRoute: ثورة في توجيه الطبقات لتحسين السياسات المرتبطة بالرؤية واللغة والعمل
تقدم LayerRoute بديلاً ثوريًا للإطار التقليدي لتوجيه الطبقات في السياسات المرتبطة بالرؤية واللغة، مما يتيح مرونة أكبر وكفاءة أعلى في توليد الإجراءات. النتائج تشير إلى تحسينات ملحوظة في الأداء مع زيادة طفيفة في عدد المعلمات.
استنادًا إلى النماذج المعززة مسبقًا للرؤية واللغة (VLMs)، تعتمد سياسات الرؤية-اللغة-العمل (Vision-Language-Action) على توليد الإجراءات للتحكم في الروبوتات. تقدم LayerRoute واجهة جديدة لتوجيه الطبقات المرتبطة بالعمل، مما يعزز من الوصول المرن لمستويات وتمثيلات VLM. يتمثل الابتكار الرئيسي في كيفية تكوين Layer Mixture Router لمستويات مختلطة ديناميكيًا من التمثيلات المخزنة، بينما يتيح آلية Action-State Reread إعادة استخدام تمثيلات العمل السابقة. أثبت LayerRoute فعاليته عبر مجموعة متنوعة من التجارب في المحاكاة والعالم الحقيقي مسجلاً تحسينات تصل إلى 7.2 في مؤشر LIBERO Long مع إضافة طفيفة فقط في عدد المعلمات لا تتجاوز 0.31% و3.87%. أبرزت الدراسات البحثية فوائد التوجيه القائم على العمل في تخصيص الموارد عبر مستويات العمل والإعدادات المختلفة، مما يفتح الأبواب أمام تطبيقات جديدة في مجال الروبوتات. هذه النظرة الجديدة تعيد تشكيل كيفية تعامل الأنظمة مع تداخل الطبقات المختلفة وتتطلب مزيدًا من الاستكشاف والتفاعل من قبل الباحثين والممارسين في هذا المجال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
