في عالم الذكاء الاصطناعي، يكمن التحدي الكبير في كيفية تفاعل الوكلاء مع العالم المحيط بهم ومع المستخدمين. يقدم البحث الجديد على منصة arXiv نموذجًا مبتكرًا يُعرف باسم extbf{ARC} (تحسين المزايا عبر تنظيم المشروط)، والذي يدور حول إمكانية وجود سلوكيات متعددة صحيحة في التفاعلات الحقيقية المفتوحة. يسمح هذا النموذج للوكلاء بالإجابة مباشرة، أو طلب التوضيح، أو تقديم تحديثات، أو التأكيد قبل اتخاذ أي إجراء، مما يكسر الافتراضات الأساسية حول التعلم المعزز القائم على المجموعة.
المشكلة الكبرى هنا هي أنه في حال كان هناك تنوع في أساليب التفاعل، فإن تفضيلات نماذج المكافآت قد تضلل المقارنات النسبية بين السلوكيات. لذلك تمثل extbf{مشاكل عدالة المكافآت} إحدى النقاط المحورية في هذا البحث.
يبدأ الباحثون في صياغة طريقة تقدم extbf{ARC}، والتي تعتمد على تنظيم مجموعات السلوكيات، مع مكافآت هجينة وتنظيم الانتروبيا. وقد أثبتت الدراسة التجريبية أن extbf{ARC} تقوي بشكل كبير معايير استخدام الأدوات، حيث قللت الوقت اللازم للوصول إلى الإخراج الأول من 4.91 ثانية إلى 1.27 ثانية.
بالإضافة إلى ذلك، يقدم البحث نموذجًا جديدًا يُسمى extbf{inter}، الذي يتيح تفاعلًا حساسًا وقابلًا للتوجيه، مع إمكانية فك ارتباط التواصل المرئي عن التفكير الأساسي واستخدام الأدوات. سيتوفر نموذج extbf{ARC} وبيانات التدريب extbf{inter-86K} للجمهور قريباً، مما يمثل خطوة كبرى نحو تحسين التعلم التفاعلي.
ابتكار ARC: ثورة في مقارنة المزايا في التفاعلات الحقيقية المفتوحة!
يكشف البحث الجديد عن نموذج ARC الذي يعيد تعريف التفاعل بين الوكلاء والبيئة. يعالج مشاكل العدالة في المكافآت ليعزز من تجربة التعلم التفاعلي الفعّال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
