في عالم يتسارع فيه تطور الذكاء الاصطناعي، أصبح الأمان أحد القضايا المحورية لمطوري نماذج الذكاء الاصطناعي. يتم الاعتماد على تدابير الوقاية المتعددة لمنع الاستخدامات المفرطة والأذى المحتمل، لكن قلة من الأدلة العامة تعرفنا على مدى فعالية هذه التدابير. هنا يظهر معيار FAR.AI للحد الأدنى من الحماية، الإصدار 1.0.

يتضمن هذا المعيار تصنيفًا يضم 67 تقنية غير متاحة للتلاعب، بالإضافة إلى منهجية لتركيب هذه التقنيات لإنشاء مجال هجمات كبير. تم اختبار نماذج رائدة مثل Claude FableGPT-5.6 Sol، Gemini 3.1 Pro، وGrok 4.5 في إطار هذه الدراسة، وقد تم تقييم أدائها ضد مجموعة تتكون من 360 هدف هجوم تتنوع بين تهديدات كيميائية وبيولوجية ومواد مشعة وأبحاث Cyber Offensive.

تستخدم الدراسة منهجية من ثلاث مراحل لتحديد أساليب التلاعب العالمية، حيث تم التعرف على قوالب طلبات تؤدي إلى ردود تتوافق مع أكثر من 75% من الأهداف في مجالات معينة. من المثير للاهتمام أن الدراسة قدمت مقياس تكلفة التجاوز، الذي يعد نموذجًا مباشرًا لتكاليف المهاجمين، ووجدت زيادة كبيرة في تكلفة انتهاك نماذج معينة.

كان التباين في القوة إلى حد كبير؛ حيث تراوحت تكلفة كسر هذه النماذج بمعدل يزيد عن مئة ضعف. ووجدت عمليات البحث العشوائية عن تقنياتها 63 تلاعبًا عالميًا ضد Grok 4.5 و18 ضد Gemini 3.1 Pro، مع متوسط تكلفة حوالي 58 و278 دولار لكل تلاعب، بينما أدت التركيب من قبل خبراء إلى رفع هذه الأرقام إلى 385 و231.

أما بالنسبة لـ Claude Fable 5 و GPT-5.6 Sol، فلم تنتج أي تلاعب عالمي تحت أي من الاستراتيجيات. ومع ذلك، فإن تلبية معيار FAR.AI تتطلب فقط تدابير دفاعية تم وصفها علنًا وتطبيقها في الإنتاج في أماكن أخرى، مما يتيح إمكانية سد هذه الفجوات باستخدام التقنيات الحالية.

في النهاية، يشدد الباحثون على أهمية الدفاع في العمق الذي يجمع بين التفكير، والتفعيل، ورصد المدخلات/المخرجات. لمزيد من المعلومات، يمكن الاطلاع على النتائج بالكامل في موقع FAR.AI.