يُعتبر تعلم الروبوتات العامة أحد التحديات الكبيرة في مجال الذكاء الاصطناعي، حيث يتطلب ذلك تحسين التعليقات التي تُميز بين التقدم الفعلي والركود أو السلوك غير المكتمل. وفي خضم هذه التحديات، تظهر تقنية TOPReward، وهي وسيلة مبتكرة لتقييم تقدم الروبوتات دون الحاجة إلى تدريب مسبق على نماذج المكافآت.
تعتمد TOPReward على تحليل احتمالات الرموز الداخلية في نماذج الفيديو واللغة (Video-Language Models)، مما يتيح للروبوت قياس مدى اكتمال المهمة المعطاة بناءً على فيديو وتعليمات لغوية دون الحاجة إلى نماذج مكافآت مُعينة أو بيانات مُعلمة يدوياً.
تمت تجربة هذه التقنية على مجموعة بيانات ManiRewardBench التي تضم 130 مهمة فريدة عبر أربع منصات روبوتية، بالإضافة إلى بيانات Open X-Embodiment. وتفوق أداء TOPReward بشكل ملحوظ على أساليب مكافآت VLMs السابقة التي لا تحتاج إلى تدريب، مما يؤكد فعاليتها.
علاوة على ذلك، تُظهر التحليلات الإضافية أن هذه المكافأة حساسة للتعليمات المحددة، وليست مجرد نتيجة زمنية، ما يفتح آفاقاً جديدة لاستخدامها في تطبيقات متعددة مثل كشف النجاح وتكرار السلوك المدعوم بالمكافآت.
تكنولوجيا جديدة: تعريف TOPReward كمكافآت خفية للروبوتات دون تدريب!
تقدم TOPReward طريقة مبتكرة لتقييم تقدم الروبوتات دون الحاجة لتدريب خاص. يتم قياس كفاءة الأداء من خلال تحليل نماذج الفيديو واللغة، مما يؤدي إلى تحسينات ملحوظة في التعليمات المعقدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
