تُعتبر البحوث القانونية واحدة من أكثر المهام التي تتطلب الوقت والجهد في مجال القانون، حيث يتعين على المحامين تحديد السلطات القانونية، والتحقق من صحتها، والتوفيق بين القوانين والأحكام القانونية، وصياغة إجابات موثوقة. ومع تقدم تقنيات الذكاء الاصطناعي، تظهر نماذج اللغة (Language Models) كأدوات واضحة تسهم في تسريع وإنجاز هذه العمليات البحثية الشاقة.

ولكن، كيف يمكن أن نقيّم فعالية هذه النماذج ضماناً لموثوقية المعلومات المستخرجة؟ هنا يأتي دور مشروع "معيار البحث القانوني" (Legal Research Bench - LRB)، الذي يتمثل في تطوير معيار يضم 413 سؤال بحث قانوني مفتوح، تمت صياغتها على يد خبراء، مع تزويد كل سؤال بإجابة موثوقة ومراجع داعمة.

يعتمد المعيار على تقييم أداء 13 نموذجًا من النماذج اللغوية المتقدمة، والتي تم اختبارها في مجموعة من المهام تشمل البحث على الويب، والبحث في القضايا القانونية، وتقنيات استرجاع المعلومات. ولتحديد دقة الاستجابات، يتم استخدام نظام تصنيف يعتمد على التحقق من المصادر، حيث تُعتبر الإجابة صحيحة فقط إذا تحقق كل معيار مطلوب وتم التحقق من السلطات القانونية المحددة.

غير أن النتائج أظهرت أن النماذج الحالية لازالت بعيدة عن الموثوقية، حيث أن أفضل نموذج تم اختباره، Claude Opus 4.8، نجح فقط في تقديم إجابات صحيحة بنسبة 42.9% عن الأسئلة. وتبين أن الأداء يختلف بشكل كبير بحسب نوع المهمة، حيث تتراوح معدلات النجاح من حيث توافق الإجابات مع القوانين المتضاربة.

كما تشير النتائج إلى أن عدد الجمل، والاتصالات بالأدوات، وتكاليف الاستدلال لا تتنبأ بدقة أعلى.

إن هذا البحث يعطي للحقل القانوني نافذة للتساؤل: هل يمكن للذكاء الاصطناعي أن يساهم في توفير أدوات أكثر موثوقية للمحامين في المستقبل، أم أن الطريق لا يزال طويلاً؟