في عالم الذكاء الاصطناعي المتطور، تُصبح نماذج الحراسة (Guard Models) أداة أساسية لحماية وكلاء النماذج اللغوية الضخمة (Large Language Models) من ارتكاب أفعال غير مسموح بها. ولكن هل يكفي فقط حظر بعض الأفعال لضمان سلامة الوكلاء؟ تشير الأبحاث الجديدة إلى أن ذلك لا يكفي!

تؤكد الدراسة التي صدرت مؤخرًا على أن سلامة الوكلاء تعتمد أيضًا على تحديد الالتزامات (Obligations) التي لم يُنفذها الوكيل، مما يعني أن تحديد الأفعال المحظورة ليس سوى جزء من المعادلة. في دراسة أولية أجريت على معيار رائج لتقييم السلامة، وجد الباحثون أن 56.92% من مسارات النموذج GLM-5.3 تحتوي على التزامات غير مُنفذة، في حين أن 30% فقط من المسارات احتوت على أفعال محظورة. يكشف هذا الاكتشاف عن أن الالتزامات غير المنفذة تعتبر مصدرًا رئيسيًا للخطر في السلامة تم التغاضي عنه سابقًا.

لمعالجة هذه الثغرة، قدم الباحثون ObligationBench، وهو أول معيار لتقييم القدرة على تحديد الالتزامات، مع تضمين 240 مسارًا تم التحقق منها من قِبل خبراء، تتناول حل المشكلات وتطوير الميزات والعمليات النهائية. ومع ذلك، أظهرت التقييمات على 14 نموذجًا تمثيليًا لبعض القيود الملحوظة، حيث كانت أعلى نسبة تذكير (Recall) والمطابقة الدقيقة (Exact Match) 48.97% و10% على التوالي.

برز ObligationGuard كأداة جديدة تستخدم 40,000 مثال تدريبي صناعي، حيث حقق 57.52% في نسبة التذكير و21.67% في المطابقة الدقيقة، متفوقًا على جميع النماذج التي قُيِّمت.

يدعو الباحثون الآن المجتمع الأكاديمي والصناعي إلى دمج تحديد الالتزامات في تصميم نماذج الحراسة المستقبلية لتحسين سلامة الوكلاء.

ما رأيكم في أهمية تحديد الالتزامات في نماذج الحراسة؟ شاركونا أفكاركم في التعليقات!