في عالم يتزايد فيه الاعتماد على نماذج اللغة الكبيرة (Large Language Models) كأدوات مساعدة في المجال القانوني، تظهر العديد من التحديات، ومن أبرزها الظاهرة المعروفة بـ "وهام وكالات القانون". حيث تؤدي أخطاء الاستدلال واستخدام الأدوات إلى خلق أحكام مغلوطة واستشهادات غير دقيقة في بعض الأحيان.

Traditionally, the benchmarks used to evaluate legal agents have been limited to مراعاة أداء ردود الفعل في حالات السؤال والجواب من مرحلة واحدة، مما يحرمنا من تصنيف الأخطاء الحاصلة. لذا، يبرز هنا LexAgentHallu كحل مبتكر، حيث يهدف إلى التقييم الدقيق لماهية الفشل وكيفيته لدى وكلاء القانون على مدى مراحل متعددة.

يستند LexAgentHallu إلى عملية تطوير مكونة من أربع مراحل، ويحتوي على 3414 حالة تم تصنيفها ضمن 17 فئة قانونية و6 أنواع من المهام. يتم تصنيف كل حالة وفقاً لتصنيف ثنائي المستوى يتكون من 7 فئات رئيسية و27 مجموعة فرعية دقيقة، مما يغطي الأخطاء الجوهرية والإخفاقات الإجرائية.

تم تصميم مقاييس دقيقة تقيس إلى أي مدى وأين تحدث كل حالة فشل على مسار التنفيذ الخاص بالعميل. تُظهر نتائج تقييمنا عبر 18 وكيلًا مملوكًا ومفتوح المصدر تأثير "الإجابة الصحيحة - السبب الخطأ"، مما يكشف عن تشكُل الفئات الفرعية للعملية، حيث تتجمع بدلاً من أن تنتشر، مشكّلة أنماط معينة.

تعتبر هذه النتائج حيوية لفهم كيف تؤثر وكالات القانون على الجودة القانونية، مما يشير إلى القوة التشخيصية لـ LexAgentHallu في تقييم وهميات الوكلاء في القانون.