تعتبر مهام التقاط ووضع الأشياء (pick-and-place tasks) من أكبر التحديات التي تواجه الروبوتات في البيئات التجارية، مثل المتاجر الكبيرة. تزداد الأمور تعقيداً بسبب الترتيبات الكثيفة للأشياء، والتداخلات، بالإضافة إلى اختلافات الصفات الخاصة بالأشياء مثل اللون، الشكل، الحجم، والملمس. كل هذه العوامل تؤثر سلباً على تخطيط مسارات الحركة وإمكانية الإمساك بالأشياء.

تقدم دراستنا الجديدة حلاً مبتكراً يتمثل في تصميم خط أنابيب للمعالجة الإدراكية-الحركية يعتمد على الإرشاد البصري المدعوم بالتعليقات (annotation-guided visual prompting). حيث تستخدم بوكسات التحديد لتحديد الأشياء القابلة للإمساك والأماكن المناسبة لوضعها، مما يوفر إرشادات مكانية منظمة.

بدلاً من اتباع خطوات التخطيط التقليدية، نستخدم تقنية تقطيع الإجراءات مع المحولات (Action Chunking with Transformers - ACT) كخوارزمية تعليم بالمحاكاة، مما يمكّن الذراع الروبوتي من التنبؤ بسلاسل الإجراءات المقطعة استنادًا إلى عرض البشر. تظهر التقييمات التي أجريناها على نظامنا بناءً على معدل النجاح وتحليل السلوك البصري عند الإمساك بالأشياء أن النظام قد حسن دقة الإمساك والقدرة على التكيف في البيئات التجارية.

مع هذه التطورات الجديدة، قد يشهد مجال الروبوتات في المستقبل القريب تحسناً كبيراً في القدرة على أداء المهام المعقدة، مما يعزز من كفاءة العمليات التجارية.