تُعتبر حركة الروبوتات الرباعية الأرجل تحدياً تقنياً معقداً يتطلب تقنيات متقدمة لتحسين الأداء. غالباً ما يتم تدريب سياسات الحركة لهذه الروبوتات باستخدام التعلم المعزز (Reinforcement Learning)، والذي يعتمد بشكل كبير على وظائف المكافآت المصممة يدوياً. تكمن المشكلة في أن تصميم هذه الوظائف يتطلب جهدًا كبيرًا، ومن الصعب معرفة أي مكافآت محلية ستؤدي إلى السلوك العالمي المطلوب.

من الممكن أن تقدم المواصفات الرسمية مثل اللغات الزمنية الإشارية (Signal Temporal Logic - STL) مزيدًا من الوضوح في المكافآت، لكنها تتطلب خبرة ميدانية في الكتابة. هنا تأتي نماذج اللغات الكبيرة (Large Language Models - LLMs) للمساعدة، حيث يمكنها توليد مواصفات Parametric Signal Temporal Logic (PSTL) التي تُستخدم لاحقًا في تعلم السياسات.

قامت الدراسة باستخدام نماذج مثل GPT-5.5 و Qwen 3.6 لتقديم قوالب STL للأمر وتعقب الحركة والسلامة وبنية المشي. يتم ملء معلمات هذه القوالب باستخدام مسارات الخبراء، وتبقى المواصفات المتوافقة فقط مع سلوك الخبراء.

ثم تُحوَّل المواصفات الناتجة إلى وظائف مكافآت سلسة، تُستخدم لتدريب سياسة حركة للروبوتات الرباعية الأرجل باستخدام طريقة Proximal Policy Optimization (PPO) في بيئة MuJoCo XLA (MJX). تم تقييم السياسات في بيئات مختلفة:
- **بيئة تعرف على أنماط الحركة**: تحدد أنماط مثل المشي والجري.
- **بيئة لا تعرف على أنماط الحركة**: تتيح أنماط الاتصال أن تظهر من الهدف الأساسي.

أظهرت النتائج أن مواصفات Qwen 3.6 حققت نسبة نجاح في البقاء والأوامر تصل إلى 100% عبر جميع السرعات المخُتَبرة (بين 0.3 و 2.1 م/ث)، بينما لم تحقق نماذج Text2Reward أي نجاح عند سرعات أكبر من 1.9 م/ث. هذا الإنجاز يفتح أبواباً جديدة لتحسين تصميم الروبوتات والحركات بشكل مبتكر وفعّال! ما رأيكم في هذا التطور؟ شاركونا في التعليقات.