في عالم الذكاء الاصطناعي، تُعتبر النماذج المتجسدة (Embodied Models) جزءاً أساسياً من تطوير التقنيات الحديثة. لكن، لماذا لا تستجيب هذه النماذج لأخطائها الخاصة؟ هذا هو السؤال الذي tackledته دراسة جديدة تم طرحها على منصة arXiv تحت عنوان "سبوتير". النقطة الرئيسية هنا هي أن الأخطاء التي تحدث قد توفر معلومات قيمة بشأن كيفية تحسين الأداء في المحاولات التالية.

دراسات سابقة أظهرت أن النماذج المتجسدة تواجه صعوبة في التعلم من أخطائها، ولكن 'سبوتير' يأخذ خطوة جريئة إلى الأمام. حيث يقترح نموذج 'سبوتير' كيفية عكس الأدوار بين النماذج المتجسدة ونماذج التصور اللغوي (VLM). في هذا النموذج، يقوم النموذج المتجسد بتنفيذ المهام بينما يتولى نموذج VLM دور المراقب المساعد الذي يتدخل فقط عند حدوث خطأ.

وفقاً للدراسة، استخدم الباحثون نموذج Qwen وGPT كنماذج للغة، وتم الحصول على تحسينات ملحوظة في الأداء. على سبيل المثال، تم تحسين سياسة Cosmos وπ_{0.5} بنسبة 5.6 و7.5 نقطة مئوية على RoboCasa. في محاكاة أُخرى، ارتفع الأداء من 53% إلى 83% على نموذج حقيقي.

يتضح أن هذا التحسين في الأداء يحدث مع تقليل الوقت الذي يستغرقه الطراز المدعوم بـ VLM بالمقارنة مع الأساليب التقليدية. من المثير للاهتمام أن هذا يفتح آفاق جديدة لاستكشاف كيف يمكن للنماذج الذكية أن تتعلم من خلال الأخطاء وتتحسن بشكل ذاتي.

للمهتمين بمجال الذكاء الاصطناعي، الكود المستخدم في التطبيق متاح على GitHub لتعزيز المبادرات البحثية وفتح المجال للتطوير المستقبل.