في عالم يتسم بتطور سريع في تقنيات الذكاء الاصطناعي، قدم الباحثون معيارًا جديدًا يُعرف باسم LPS-Bench لتقييم أمان وكلاء استخدام الكمبيوتر (Computer-Use Agents) أثناء التخطيط طويل المدى. يتوزع هذا المعيار على 570 حالة مستمدة من 65 سيناريو عبر 7 مجالات مهمة، مما يسمح بتحديد كيف يتفاعل الذكاء الاصطناعي مع الأدوات في ظروف مختلفة.
أحد التحديات الرئيسية التي يواجهها الذكاء الاصطناعي هو عدم القدرة على التنبؤ بالعواقب الناتجة عن قرارات غير آمنة يتم اتخاذها في مراحل مبكرة من تنفيذ المهام. ولتجاوز هذا التحدي، تم تصميم LPS-Bench لعرض مجموعة متنوعة من السيناريوهات، بما في ذلك الحالات السلمية وتلك التي تتطلب تحكمًا معاديًا. يعتمد النظام على مبدأ توجيه التعليمات عبر نظام متعدد الوكلاء يوفر بيئة اختبار شاملة.
تخيل أن تُمكن الذكاء الاصطناعي من اتخاذ قرارات آمنة وموثوقة في الأنظمة المعقدة! تقوم طريقة التقييم المعتمدة على نماذج اللغات الضخمة (Large Language Models) بتحليل اختيارات الأدوات، وتقديم الحجج، وتقييم الاستجابات للإشارات البيئية خلال تنفيذ المهام. بحسب التقييمات، لوحظ أن 13 وكيلًا من نماذج الذكاء الاصطناعي تكافح لتحقيق الأمان في كل من السيناريوهات السلمية والمعادية.
على الرغم من أن التدخلات المعتمدة على المحفزات تُظهر تحسنات تعتمد على النموذج، إلا أن الفشل في تحقيق الأمان يبقى قضية مستمرة. لذا، سيكون من المثير متابعة كيف سيساهم LPS-Bench في تحسين عمليات التخطيط البشري والذكاء الاصطناعي في المستقبل.
LPS-Bench: مستقبل تقييم أمان الذكاء الاصطناعي في التخطيط طويل المدى!
تم إطلاق LPS-Bench، معيار جديد لتقييم أمان وكلاء استخدام الكمبيوتر في التخطيط طويل المدى. يكشف البحث عن نقاط ضعف مستمرة في أداء نماذج الذكاء الاصطناعي تحت سيناريوهات غير مؤذية ومعادية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
