في عالم الذكاء الاصطناعي، تلعب آلية التخطيط المعتمد على التغذية الراجعة (Feedback-based Planning) دورًا حيويًا في تعزيز موثوقية الوكلاء من خلال دمج الملاحظات الإرشادية والتغذية الراجعة التصحيحية. ومع ذلك، أظهرت دراسة جديدة من خلال تحليل دوري لآليات التغذية الراجعة أن الحماية ضد التهديدات قد لا تكون متوزعة بشكل متساوٍ عبر مراحل التخطيط.

تشير النتائج إلى وجود ضعف في تثبيت البيانات الأولية، حيث يقوم الدور الأول من التغذية الراجعة بتصحيح 46% من الاتجاهات العدائية، بينما تتراجع هذه النسبة بشكل حاد إلى 13% و7% في الأدوار التالية. وقد أرجع الباحثون هذا الضعف إلى ثلاثة عوامل متفاعلة: تحول منطقي في الخطة الأولية، نقص في الأدلة المضادة، واستمرار الاتجاهات المقبولة في المسار المتراكم.

استناداً إلى هذه النتائج، تم اقتراح إطار عمل جديد يُدعى 'InitAnchor'، والذي يمكن المهاجمين من استغلال هذا الضعف من خلال مواد خارجية مسيطرة. يقوم 'InitAnchor' بتشغيل العوامل الثلاثة كإشارات تدل على التحول الاتجاهي، والجدارة السياقية، والمرونة ضد الأدلة المضادة، سواء في حالة الوصول المحدود إلى الأهداف أو عدم الوصول بالتأكيد.

عبر 112 مهمة تم جمعها من 16 مجالًا، و6 هياكل لوكلاء، و5 نماذج لغات ضخمة، حقق 'InitAnchor' معدلات نجاح إجمالية تتراوح بين 76.1% و72.0% تحت الإعدادات المختلفة، بينما انخفضت معدلات التخفيف في الجولة الأولى إلى 21.0% و25.0%، على التوالي. علاوة على ذلك، أثبت 'InitAnchor' أنه فعّال ضد ستة دفاعات ومجموعات من أنظمة الوكلاء الموجودة في العالم الحقيقي.

تُظهر هذه النتائج أن الوكلاء المعتمدين على التغذية الراجعة يمكن أن يحتفظوا بالتحيزات المبكرة حتى في ظل توفر التصحيحات اللاحقة.

ما رأيكم في هذه الاكتشافات المدهشة؟ هل تعتقد أن مثل هذه الأدوات ستغير طبيعة التخطيط في الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!