في عصر الذكاء الاصطناعي المتطور، تتزايد عمليات نشر وكلاء لغويين مستقلين (Autonomous LLM Agents) في مجالات العمل المعقدة. لكن هذه الوكلاء لا تزال تواجه مشكلة انحراف السلوك أثناء التشغيل، وهو انحراف غير ملحوظ عن المهمة الأصلية قد يؤدي إلى آثار جانبية لا يمكن عكسها على الأنظمة الخارجية. في الكثير من الأحيان، تحاول الأنظمة الحالية التعامل مع هذه المشكلة على مستوى التعليقات ولكنها تفتقر إلى الآليات المنظمة لاكتشاف الانحراف على مستوى الخطوات، وتقييم المخاطر، واتخاذ القرار للتعافي.
بهدف تلبية هذا التحدي، تم تقديم إطار عمل جديد يعتمد على الرسوم البيانية (Graph-Based Framework) يهدف إلى تطوير وحدة شفائية قابلة للتوصيل والتركيب. يعتمد هذا الإطار على تدريب نموذج لغوي صغير باستخدام تقنيات تعلم التعزيز (Reinforcement Learning) للتخصص في كل عقدة ضمن رسم بياني للشفاء.
تؤدي كل عقدة دورًا محددًا مثل تصنيف الانحراف، اكتشاف العمليات، تقييم المخاطر، أو اتخاذ القرار النهائي. يتم تدريب النموذج ليكون قادرًا على إنتاج أسباب منظمة بصيغة XML تتناسب مع الدور المخصص له. يجمع التدريب بين المكافآت الهيكلية المستندة إلى القواعد وإشارات جودة دلالية من النموذج اللغوي الكبير، مما يعني أنه يتم تقييم الأداء بناءً على كيفية إجابته (البنية والطول) وما يقوله بالفعل.
تظهر التجارب المستخدمة في معيار AppWorld العام أن هذه الطريقة تستغل معلومات حول بداية الانحراف المحتمل لاتخاذ قرارات استشفاء صحيحة باستخدام نموذج لغوي صغير. علاوة على ذلك، يحترم النموذج اللغوي المدرب الهيكل المطلوب للإخراج وينتج محتوى مناسبًا دلاليًا في كل حقل وفقًا لدور العقدة المخصص.
إن هذا التقدم يشير إلى خطوة مهمة نحو تحسين التجربة التشغيلية لوكلاء الذكاء الاصطناعي، مما يلهم في الوقت نفسه المزيد من الابتكارات في هذا المجال.
إطار تعلم تعزيز قائم على الرسوم البيانية لعلاج انحرافات الذكاء الاصطناعي في الوكلاء المستقلين
تكشف دراسة جديدة عن إطار عمل مبتكر يستخدم تعلم التعزيز لعلاج انحرافات سلوك الوكلاء المستقلين للغة الكبيرة. يعكس هذا التطور خطوة مهمة نحو تعزيز الاستقرار والكفاءة في تطبيقات الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
