في عالم الذكاء الاصطناعي، بدأنا نشهد تحولات مذهلة، وخاصةً في كيفية تعامل الوكلاء الذكائيين مع المهام الموكلة إليهم. تتضمن هذه المهام تنظيم الاجتماعات، مقارنة العروض، والتفاوض على الأسعار. لكن التحدي الأكبر يكمن في كيفية أداء هؤلاء الوكلاء أمام وكيل آخر قد تكون مصالحه متعارضة مع مصلحة المستخدم الأساسي.

لقد تم تقديم تقنية جديدة تُعرف باسم SocialRL، وهي وصفة تعمل على تدريب مهارات التفكير الاجتماعي بشكل مباشر. هذه التقنية تم تطبيقها على نموذج ذو 4 مليارات وحدة، وتم اختبارها عبر ست مجالات متنوعة: "لعبة العروض" (Deal-or-No-Deal)، "كازينو" (CaSiNo)، "كرايغليست" (Craigslist)، "مقابلة العمل"، "التقويم"، و"السوق" (Marketplace).

وقد كشفت النتائج أن التدريب داخل المجال الحيوي يمكن أن يحقق نتائج مذهلة؛ حيث سجل النموذج توافقًا مع أو تفوقًا على عائلة GPT-5 في معظم السيناريوهات، مما ساهم في سد الفجوة بين الأداء الأساسي وعالم الذكاء الاصطناعي المتقدم. بالإضافة إلى ذلك، تمكن النموذج من استخدام استراتيجيات متعددة مثل "cascade RL" و"multi-teacher on-policy distillation" (OPD) لدمج المهارات المتخصصة في إطار واحد.

ومع الكشف عن هذه المفاهيم الجديدة، يظهر كيف أن تقنيات التعلم العميق الحديثة تُحدث ثورة في كيفية تفاعل الأشخاص مع الذكاء الاصطناعي. هذا الابتكار يعتبر خطوة نحو الأمام لتعزيز كفاءة الوكلاء الذكائيين وجعلهم أكثر فاعلية في المهام التفاوضية.

ما رأيكم في هذا التطور؟ شاركونا في التعليقات!