في عالم التحكم الروبوتي، تُعد التعلم عن طريق تقليد التجارب البشرية خطوة رائدة، ولكن التحديات لا تزال قائمة. عادةً، تعتمد السياسات البصرية الحركية على ملاحظات قصيرة الأمد، مما يجعلها تكافح مع المهام المعقدة التي تتطلب الذاكرة طويلة الأمد. هنا يأتي مفهوم VPWEM، الذي يقدم حلاً مبتكرًا لحل هذه المشاكل.

تُعتبر VPWEM سياسة بصرية حركية غير ماركوفية (Non-Markovian Visuomotor Policy) مُزودة بذاكرة عاملة وتجريبية. يحتفظ هذا النموذج بشريحة من تجارب الملاحظة الأخيرة كذاكرة قصيرة الأمد، ويستخدم ضاغط ذاكرة سياقية يعتمد على تقنية تحويل (Transformer) لتحويل الملاحظات التي خرجت عن النافذة الزمنية إلى عدد ثابت من تمثيلات الذاكرة التجريبية.

تعتمد البنية على تقنية الانتباه الذاتي (self-attention) التي تعزز من القدرة على التعلم من تجارب الماضي، وتعمل بالتوازي مع الخوارزمية الرئيسية. وقد أظهرت التجارب أن VPWEM يتفوق على نماذج المنافسة بنسبة تتجاوز 20% في مهام المعالجة التي تتطلب ذاكرة كثيفة، محققاً بذلك إنجازًا كبيرًا في مجال الروبوتات.

باستخدام VPWEM، يستطيع الروبوت الآن الاستفادة من الذكريات الطويلة الأمد، مما يجعل أداءه في المهام المعقدة أكثر كفاءة وفعالية، ويُعيد تعريف كيفية تفاعل الروبوتات مع العالم من حولها. يمكنك الإطلاع على الكود المتعلق بهذا النموذج عبر الرابط التالي: [https://github.com/HarryLui98/code_vpwem].

ما رأيكم في هذا التطور الملهم؟ شاركونا في التعليقات!