في عالم Robotics، تقنيات مغلقة الدورة (Closed-Loop) تتطلب معالجة بيانات المراقبة وإدارة الحالات والفرعيات المعتمدة على الموقف، مما يجعل تصميمها وضبطها يدويًا مكلفًا. على الرغم من أن الوكلاء البرمجيين (Coding Agents) تتزايد قدرتهم على توليد وتحسين الشيفرة الخاصة بالتحكم، لا يزال من غير الواضح ما إذا كانت هذه التطبيقات التي تُحسّن أيضاً تدعم اكتساب السياسات لمهام جديدة.
بيّنت دراسة جديدة عُرضت في تكنولوجيا الذكاء الاصطناعي أن تصميم تنفيذ كامل مغلق الحلقة يمكن اعتباره خبرة تنفيذ قابلة لإعادة الاستخدام. حيث يقوم الوكيل البرمجي بتوليد الشيفرة السياسية من عدد من العروض الناجحة، ويقوم بتحسينها تدريجيًا باستخدام ردود الفعل من المحاكاة. بعد اختيار التنفيذات الصحيحة، يتم الاحتفاظ بها في أرشيف برمجي. لعلاج المهام الجديدة، يقوم الوكيل بتوليد وتحسين السياسات باستخدام تنفيذات مؤرشفة، وعروض مستهدفة، وردود الفعل التنفيذية.
تشير النتائج إلى أن التحسينات التدريجية قد زادت نسبة النجاح من 28.3% إلى 64.2% عبر أربعة مهام مصدرية في RoboCasa. ولدى تسعة مهام مستهدفة وثلاث تجارب مستقلة، كانت نسبة النجاح المتوسطة 45.2% دون مراجع، و41.5% بالشيفرة المصدرية الأولية، و57.0% مع الشيفرة المحسّنة. أظهرت النتائج أن المراجع المحسّنة تتفوق على المراجع الأولية في جميع التجارب، مع زيادة متوسطة قدرها 15.6 نقطة مئوية. هذه النتائج تستعرض قيمة البرمجيات المحسّنة من خلال التنفيذ كمورد لاكتساب السياسات الجديدة في هذا السياق، رغم أن المراجع الأولية تظل متفوقة في مهمتين مستهدفتين عند متوسط النتائج عبر التجارب.
استكشاف آفاق جديدة: كيفية تعزيز برامج الروبوتات من خلال تنفيذ مغلق الدورة
تقدم الأبحاث الجديدة في تصميم برامج الروبوتات مغلقة الدورة طرقًا مبتكرة لتحسين أداء الروبوتات في مهام جديدة. باستخدام تقنية التحسين المستمر، يزيد النجاح بشكل ملحوظ عند تنفيذ السياسات من خلال التجارب السابقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
