في عالم الذكاء الاصطناعي، يمثل تحقيق التنوع والفعالية في الأنظمة تحدياً كبيراً خاصة عند العمل تحت قيود الاقتباس. تقدم خوارزمية Dual-Force حلاً مبتكراً لتحديات تعظيم التنوع في البيانات، من خلال تحويل معلومات العرض إلى مجموعة من السياسات السلوكية المتميزة.
تتميز الخوارزمية الجديدة بتجاوزها للاعتماد التقليدي على الأهداف المتعلقة بالمعلومات المتبادلة، والتي تتطلب تدريب محاكي مهارة، مما قد يؤدي إلى عدم الاستقرار في ظل المكافآت غير الثابتة. تعمل Dual-Force على تعظيم التنوع باستخدام مُقيّم غير متصل بأهداف القوة من نوع Van der Waals (VdW)، مستفيدًة من ميزات الخلافة.
فضلًا عن ذلك، توفر الخوارزمية استقرارًا في التدريب من خلال تحفيز المكافآت الداخلية غير الثابتة، عبر تشكيل دالة القيمة والسياسات استنادًا إلى ترميز المكافأة الوظيفي (Functional Reward Encoding - FRE) المدرب مسبقًا. يسمح هذا النموذج الجديد بالتذكر الفوري لكل مهارة تم مواجهتها من خلال تمثيلها الكامن، مما يلغي الحاجة لتحديد عدد ثابت من المهارات مسبقًا.
أخذت Dual-Force اختبارها على منصتين محاكاة Solo12 (التنقل وتجاوز العوائق)، حيث أظهرت القدرة على استعادة سلوكيات متنوعة عالية الأداء مع مطابقة إشغال حالة خبير مستهدف، مما يعكس تحسينًا في القوة ضد التغيرات والمخاطر التي قد تظهر في البيئات المعقدة.
هذه التطورات تعيد تشكيل مشهد الذكاء الاصطناعي، مع تسارع الاستجابة للتحديات الكثيرة في الأوقات الحالية. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
ثورة في الذكاء الاصطناعي: خوارزمية Dual-Force تعزز التنوع وتتفوق على القيود التقليدية
تستكشف خوارزمية Dual-Force الجديدة تحسين التنوع في البيانات دون الحاجة لتفاعل إضافي مع البيئة، مما يعزز من قوة النماذج الذكية. هذا الابتكار يعد بفتح آفاق جديدة في تطوير السياسات السلوكية للمساعدات الذكية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
