في عالم الذكاء الاصطناعي، تكون سلامة الأنظمة المدعومة بالنماذج اللغوية (Language Models) أمرًا بالغ الأهمية، خاصة في تفاعلها مع أدوات وبيئات خارجية. تواجه هذه النماذج تحديًا كبيرًا يتمثل في الإنذارات الكاذبة، التي تأخذ وقتًا وجهدًا كبيرين للتحقق منها، مما يؤدي إلى التأثير على الثقة بين المستخدمين.

مع استخدام المراقبون للحفاظ على سلامة الوكلاء (Agents)، يمكن أن تولد الإدارة المحافظة العديد من الإنذارات الكاذبة. إذ غالبًا ما تتداخل الإنذارات الكاذبة مع الإنذارات الصحيحة في نتائج المراقبة، مما يجعل من الصعب تحديد عتبات موثوقة بدون تحقق يدوي شاق.

في هذه الحالة، تظهر الحاجة إلى إطار عمل جديد يتيح المعالجة الفعالة للإنذارات الكاذبة باستخدام نهج يسمى التعلم الإيجابي غير الموسوم (Positive-Unlabeled Learning). يقدم البحث الجديد، والذي يتناول هذا الموضوع، إطار عمل من خطوتين يركز على الإدارة الذكية للإنذارات.

الخطوة الأولى هي "توجيه المراقبة الحساسة للثقة"، حيث يتم تكييف المراجع الآمنة بما يتناسب مع مجال الإنذار. في هذه الخطوة، يتم حماية الإنذارات المحتملة من ضغط سلبي مفرط. أما الخطوة الثانية فهي "تقطير الترتيب القائم على الموثوقية"، حيث يتم دمج تفضيلات الترتيب المتسقة من نماذج مختلفة لتحقيق ترتيب أفضل في نموذج واحد. أخيرًا، يُعزز "تحسين الهيكل القائم على التوافق" تصنيف هذا النموذج باستخدام الدعم من المراجع الآمنة والعلاقات بين الإنذارات.

من خلال هذه الطريقة، ينجح النموذج في تحقيق متوسط دقة AUPRC بنسبة 0.6444، متفوقًا على ثمانية نماذج أخرى تم تقييمها. بل يتفوق أيضًا على أقوى نموذج في هذا المجال بنسبة تصل إلى 33.3% في تقليل الإنذارات الكاذبة مع الحفاظ على ميزانية مراجعة 5%. تُظهر هذه النتائج الكبيرة ضرورة الابتكار في مجال سلامة الذكاء الاصطناعي وتعزيز الثقة في الأنظمة المدعومة بالذكاء الاصطناعي.