في ظل التطورات المستمرة في مجال الذكاء الاصطناعي، تظهر الحاجة إلى أطر عمل دقيقة تضمن فعالية هذا النظام في سيناريوهات معقدة. اليوم، نعرض لكم نظام RegLLM، وهو نظام تشخيصي مبتكر يهدف إلى تقييم القدرات المحدودة ضمن مسارات العمل المنظم للذكاء الاصطناعي الموجه (Agentic AI).

يتكون RegLLM من ستة مؤشرات موثوقية تشمل:
1. **صلاحية الاقتباسات (Citation Validity)**: تقييم مدى اعتماد المعلومات المقدمة على مصادر موثوقة.
2. **أساس المصادر (Source Grounding)**: التأكد من أن المصادر المرتبطة بالمعلومات المولدة موثوقة.
3. **امتثال المخطط (Schema Compliance)**: التحقق من توافق الإجابات مع الإطار الهيكلي المطلوب.
4. **صواب التصعيد (Escalation Correctness)**: قياس دقة التصعيد عند الحاجة للقرار.
5. **محاذاة دستورية (Constitutional Alignment)**: التأكد من أن قرارات الذكاء الاصطناعي تتماشى مع المعايير الأخلاقية والقانونية.
6. **معدل التصرفات غير الآمنة (Unsafe-Action Rate)**: قياس كمية التصرفات الخاطئة أو غير المرغوبة.

كل من هذه المؤشرات للدقة ينتمي إلى نوع محدد من الإشراف مثل المدققين البرمجيين أو العلامات التصعيدية على مستوى المهام. في الواقع، يمكن للمشرفات المعتمدة على الذكاء الاصطناعي أن تعوق الآجوبة غير المستندة إلى مصادر، كما تقوم بتسجيل أي تدخلات مطلوبة.

تقدم التجارب الأولية التي أجريت باستخدام النظام بيانات مشجعة؛ حيث زادت نسبة التذكر أثناء التصعيد بشكل ملحوظ من 0 إلى 0.67، في حين انخفض معدل التصرفات غير الآمنة من 0.33 إلى 0.08 عند تفعيل آلية الحوكمة.

وعلى الرغم من أنه يُظهر أن وجود متغيرات قليلة يعد مؤشراً على أهمية الدقة في التكوين، إلا أن هذه التجارب لا تؤكد فعالية توفر تأثيرات موثوقة.

يسلط النظام الضوء على الحاجة إلى مجموعات تقييم أكبر وعدد أكبر من التجارب لتأكيد النتائج وتقديم رؤى أفضل حول التوجهات المستقبلية في الذكاء الاصطناعي.