في عالم اليوم المتقدم تقنيًا، يمثل الذكاء الاصطناعي أحد أبرز مجالات الإبداع والابتكار. وفي خطوة رائدة نحو تعزيز فاعلية نماذج التعلم المعزز في اتخاذ القرارات، تم إطلاق JevAdvBench، وهو معيار هجومي مصمم خصيصًا لقياس مدى مقاومة هذه النماذج للهجمات المعادية.

نماذج التعلم المعزز لاتخاذ القرارات (Reinforcement Learning for Calibrated Decisions - RLCD) مثل نموذج Jev، تقوم بالاستجابة لأسئلة معينة استنادًا إلى حالة أو مدخلات معينة، مما يوفر إجابات موثوقة ودقيقة. إلا أن تحديد مدى قوة هذه النماذج ضد التلاعبات والهجمات يبقى تحديًا كبيرًا، وهو ما يسعى JevAdvBench لمعالجته.

الخاصية الفريدة لجهاز JevAdvBench تكمن في قياس كل قرار تعرض لهجوم بما يتماشى مع النتيجة النظيفة التي كان ينبغي للنموذج تقديمها، بدلاً من الاعتماد على تسميات خارجية قد تكون غير موثوقة. يتكون المعيار من 812 سؤالًا منسقًا عبر 66 سيناريو، بالإضافة إلى مجموعة من 9,744 نموذج هجوم يسمح لكل منها بتعديل جزء واحد من الطلب، مما يضمن وصول التعديل إلى النموذج نفسه.

تتناول النتائج الأولية هذه القرارات وتظهر أنه في الإصدارات الأولى، يبقى إعادة صياغة الأسئلة ضمن 1.2 نقطة مئوية من خط الأساس المعاد. من جهة أخرى، تشير النتائج إلى أن إضافة رأي غير موثق يمكن أن يغير 12.1% من القرارات، مما يثير تساؤلات حول موثوقية المدخلات.

إن تطبيقات نماذج RLCD تحتاج بالتالي إلى التعامل مع الحالة كمدخل غير موثوق، مما يعود بالنفع على توجيه النموذج نحو قرارات أقوى وأكثر موثوقية. لمزيد من المعلومات، يمكن زيارة موقع المشروع الرسمي.