في عالم الذكاء الاصطناعي، يشهد استخدام أنظمة الذكاء الاصطناعي في تقديم الاستشارات القانونية ارتفاعاً ملحوظاً، لكن هناك قضية مهمة تحتاج إلى تسليط الضوء عليها. معظم benchmarks الحالية تفترض أن الاستفسارات تصل كاملة، بينما في الواقع، غالباً ما يغفل المستخدمون حقائق هامة تؤثر بشكل كبير على النتائج القانونية.

لذا، تم تقديم InsufficiencyBench، وهو benchmark قانوني جديد يهدف إلى اختبار قدرة النماذج على التعرف على ظروف نقص المعلومات القانونية، وتحديد ما هو مفقود، والامتناع عن إصدار استنتاجات مسبقة. يشتمل هذا المشروع على تصنيف من ثمانية فئات رئيسية من العناصر المفقودة عبر ثلاثة أنماط من الفشل البنيوي، هي: التحويل، التحفيز، والمتطلبات القاتلة. وقد تم تصميم 202 عنصر تقييم تشمل 58 استفسار أساسي و144 نموذج ناقص، تغطي ستة مجالات قانونية و24 ولاية أمريكية وتمت مراجعتها بواسطة محامين محترفين.

الغريب في الأمر هو نتائج التقييم التي ظهرت عند تطبيق InsufficiencyBench على عشرة نماذج متقدمة، حيث لم يتجاوز أي نموذج تقييم F2 = 0.46 في تحديد العناصر المفقودة، وكان المتوسط العام للاسترجاع 0.44. أصبحت المشكلة أكبر عندما وجدنا أن النماذج تتردد بشكل عشوائي أو تقدم إجابات صامتة تحت افتراضات مُصطنعة. لم ينجح أي نموذج في كل من تحديد وتقييم الاستجابات للاستفسارات الناقصة بينما يعالج في الوقت نفسه تلك المكتملة.

تمثل هذه النتائج دعوة للتفكير في كيفية تعزيز كفاءة تطبيقات الذكاء الاصطناعي في مجالات القانون بما يضمن تلبية احتياجات المستخدمين بشكل فعال.