في عالم الذكاء الاصطناعي، أصبح وجود وكالات قائمة على نماذج لغوية كبيرة (LLMs) يؤدي مهاماً معقدة بشكل متزايد أمراً شائعاً. وقد برزت "مهارات الوكيل" كآلية مرنة لتعزيز القدرات، حيث تتضمن حزم تعليمات خاصة بالمهام ومكونات قابلة للتنفيذ وموارد إضافية لتوفير وظائف متخصصة. ومع ذلك، فإن الانتشار المتزايد لSkills من أطراف ثالثة يفتح نافذة جديدة لهجمات سلسلة التوريد.

تستطيع المهارات الخبيثة أن تتضمن سلوكيات ضارة تستغل امتيازات الوكيل وتعرض بيئة تنفيذه أو الموارد المتاحة للخطر. ورغم أن الطرق الحديثة في تدقيق مهارات LLM قد حققت أداءً واعدًا، إلا أنها غالباً ما تعتمد على نماذج لغوية تجارية قوية. تبقى كيفية تحقيق تدقيق فعال باستخدام نماذج لغوية مضغوطة في إعدادات حساسة للأمان وذات موارد محدودة غير مستكشفة بشكل كافٍ.

تكشف تحقيقاتنا أن هذه النماذج المضغوطة تواجه صعوبة في التعرف على السلوكيات الخبيثة المخفية داخل حزم Skills المعقدة. تعود هذه الصعوبة لكل من الطبيعة الضمنية لتلك السلوكيات والسعة المحدودة للتفكير في LLMs المضغوطة. لمواجهة هذه التحديات، نقدم SKILLLITE، وهو إطار يوجهه الدليل لاكتشاف المهارات الخبيثة.

يستخرج SKILLLITE بذكاء السلوكيات ذات الصلة بالأمان ويستنتج الوظيفة المقصودة من حزم Skills المعقدة. ثم يستخدم نموذج LLM مضغوط لتقييم مدى خيانة المهارة بناءً على السلوكيات الملحوظة وسياقها الوظيفي. تُظهر التجارب أن SKILLLITE يُحسن كشف المهارات الخبيثة عبر نماذج LLM المضغوطة المختلفة ويحقق أداءً يفوق المعايير التقليدية. وتؤكد فعاليته أيضًا حتى مع المهارات الخبيثة المؤكدة على أرض الواقع. علاوة على ذلك، يحتفظ SKILLLITE بزمن استنتاج منخفض، مما يدعم نشره العملي في بيئات العمل.