أصبح استخدام النماذج اللغوية الكبيرة (Large Language Models) في الروبوتات جانبًا رئيسيًا في توظيف الذكاء الاصطناعي، حيث تترجم هذه النماذج التعليمات الطبيعية إلى سياسات تنفيذية مثل grasp() وmove_to() وopen_gripper(). لكن مع استخدام هذه الروبوتات أيضًا تأتي التحديات المتمثلة في هجمات الاختراق (jailbreak attacks)، التي قد تمتد من توليد محتوى ضار إلى تنفيذ سلوكيات مضرة.
تظهر الأبحاث أن محاولات اختراق الروبوتات القائمة على LLM غالبًا ما تفشل في تحفيز تصرفات ضارة فعلية، رغم أنها قد تنتج سياسات تبدو خبيثة (intent jailbreaks). هذا يعود إلى قيود خاصة بالروبوت، مثل الأخطاء المنطقية وواجهات التحكم الوهمية. في هذا السياق، قمنا بدراسة تفصيلية لفهم فجوة النية والسلوك، وتحديد الأسباب الجذرية التي تؤدي إلى هذه الفجوة.
بينما تعاني الطرق الحالية لاختراق LLM من تجاهل قيود التعبير الخاصة بالروبوت، بالإضافة إلى اجراءات الفحص المادية للتأكد من إمكانية حدوث التنفيذ.
للتغلب على هذه التحديات، قمنا بتقديم إطار العمل POEF (Policy Effective Jailbreak)، الذي يأخذ بعين الاعتبار القيود الخاصة بالروبوت خلال مراحل التقييم والتحسين. يعتمد POEF على التدرجات في الطبقات المخفية من نموذج LLM غير المتناسق لتوجيه تحسين سؤالات الاختراق، بالإضافة إلى استخدام مقيم متعدد الوكالات لتقييم الجدوى).
أظهرت التجارب على الروبوتات التجارية، بما في ذلك Unitree G1 وFranka robotic arm، نجاح إطار العمل POEF في تحقيق معدل نجاح يقدر بـ 80% في اختراق السلوك ونقل فعاليته عبر نماذج متعددة.
علاوة على ذلك، اقترحنا استراتيجيتين دفاعيتين لتخفيف مخاطر اختراق السلوك. هذه النتائج تضيف بعدًا قويًا للطوارئ لحاجة الدفاع الأقوى ضد الهجمات على روبوتات الذكاء الاصطناعي، لا سيما قبل توسيع نطاق استخدامها.
فجوة النية والسلوك: كشف النقاب عن نقاط الضعف في روبوتات الذكاء الاصطناعي
تدور أحداث هذه الدراسة حول التحليل العميق لفجوة النية والسلوك في روبوتات تعتمد على نماذج اللغة الكبيرة (LLMs)، حيث تكشف أهمية فهم التهديدات المرتبطة بها. يجب أن نكون على دراية بالوسائل القوية لحماية روبوتات الذكاء الاصطناعي قبل انتشارها بشكل واسع.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
