تواجه نماذج اللغة الكبيرة (LLMs) تحديات كبيرة في توفير استجابات آمنة وموثوقة. واحدة من أبرز هذه التحديات هي محاولات استغلال النظام من قبل مستخدمين يسعون إلى تجاوز التعليمات أو تنفيذ أوامر تضر بالسلامة. هنا يأتي دور HiveTraceGuard-Pro، نموذج الحراسة الجيلين (Generative Guardrail) الجديد، الذي يعمل على حماية النماذج من هذه التهديدات.
HiveTraceGuard-Pro هو نموذج مصغر تم تطويره باستخدام تقنية LoRA، مما يضمن كفاءة عالية في عملية التعلم. يتمتع هذا النموذج بقاعدة بيانات تشمل مجموعة واسعة من الأمثلة الضارة والمفيدة، حيث يتم تدريبه على كل من اللغتين الروسية والإنجليزية. يستخدم HiveTraceGuard-Pro قاعدة تسجيل ثنائية لتحديد مدى السلامة (safe/unsafe) لكل استجابة، مما يزيد من موثوقية النتائج.
على الرغم من وجود نماذج حراسة أخرى، إلا أن HiveTraceGuard-Pro أثبت فعاليته مقارنة باثنين وثلاثين نموذجًا آخر، حيث سجلت أداءً مبهراً في مجموعة متنوعة من المجموعات القياسية. على سبيل المثال، حصلت النماذج على درجة متوسطة تبلغ 0.7432، بينما تسجل النماذج الأفضل درجات أعلى، مثل 0.7641 و0.7552.
تجدر الإشارة إلى أن هذا النموذج أظهر أعلى نسبة امتثال روسي (Russian prompt-injection recall) والتي بلغت 0.999، بالإضافة إلى انخفاض ملحوظ في زمن التأخير الوسيط، مما يجعله خيارًا مفضلًا لمطوري نماذج اللغة.
تم نشر الأوزان المدمجة للنموذج على منصة Hugging Face بموجب ترخيص Apache-2.0، مما يتيح لمجتمع الباحثين والمطورين الاستفادة من هذه التكنولوجيا الجديدة لتعزيز أمان نماذج الذكاء الاصطناعي.
HiveTraceGuard-Pro: الحارس الذكي الجديد لحماية نماذج اللغة من التهديدات!
تقدم HiveTraceGuard-Pro نفسها كحل مبتكر لمواجهة هجمات حقن الطلبات وتعزيز أمان نماذج اللغة الكبيرة (LLMs). يدعم الحارس الجديد اللغات الروسية والإنجليزية ويتميز بفعالية عالية ورؤية متقدمة في مواجهة التحديات الأمنية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
