في عالم الذكاء الاصطناعي المتطور، تتسارع الابتكارات لتسهل التحكم في الأنظمة بشكل لم يسبق له مثيل. وفي هذا السياق، تم مؤخرًا الكشف عن طريقة جديدة تُعرف باسم 'Code to Control'، التي تستخدم نماذج اللغات الضخمة (LLM) لإنشاء وحدات تحكم بلغة بايثون تعمل مباشرة كسياسات تحكم.

تعمل هذه الطريقة على فصل هيكل البرنامج عن المعلمات، حيث يقوم نموذج اللغة باختيار بنية وحدة التحكم، بينما يتم استخدام البحث الخالي من المشتقات لضبط المعلمات من خلال التغذية الراجعة من البيئة. ما يميز هذه الطريقة هو أنها بعد تعلمها، لا تحتاج الوحدات الناتجة إلى استدلال نموذج لغوي أثناء اتخاذ القرار، مما يمكّن من اللعب في الوقت الحقيقي.

أظهرت الدراسات والتجارب التي أُجريت باستخدام 'Code to Control' نتائج مذهلة عبر مجموعة من الألعاب مثل ألعاب Atari وFlappy Bird، بالإضافة إلى مهام MuJoCo المختلفة. وتفوقت هذه الطريقة على طرق البرمجة التقليدية المعتمدة على التخطيط، وظلت تنافس تقنيات التعلم المعزز العميق بينما استخدمت تفاعلات أقل مع البيئة.

علاوة على ذلك، تتماثل سرعة اختيار الحركة في 'Code to Control' مع سرعة سياسات التعلم المعزز البعيد (PPO)، مما يجعلها خيارًا مثاليًا للتطبيقات التي تتطلب استجابة سريعة وفعالة. يفتح هذا البحث آفاقًا جديدة لكيفية التعامل مع المهام الديناميكية المعقدة، مما يمكّن الأنظمة من التكيف بسهولة مع التغيرات الكبيرة في ديناميات البيئة.