في عالم الذكاء الاصطناعي، أصبح من المعتاد أن تُعبر نماذج اللغات الضخمة (Large Language Models) عن قراراتها القانونية من خلال الإشارة إلى القوانين أو السوابق التي تدعم تلك القرارات. ولكن، ما مدى موثوقية هذه الروابط؟

في دراسة جديدة نشرتها arXiv، تم اختبار هذا التأثير مباشرةً. حيث تم الاحتفاظ بحقائق القضية ثابتة واستبدال السلطة القانونية المسماة بواحدة غير مرتبطة، لقياس كيفية تطور الحكم بناءً على هذه التغييرات. وفي النتائج، شملت التجارب سبع نماذج ذات وزن مفتوح، تراوحت أحجامها بين 8 إلى 70 مليار وزن.

واحدة من أبرز النتائج كانت أن النماذج، عند طلبها بوضوح لتبرير الحكم من خلال الإشارة إلى السلطة القانونية، نجحت في تسمية السلطة الصحيحة بنسبة تتراوح ما بين 66.7% إلى 100%. ولكن، عند تغيير السلطة، لم يكن هناك اتساق في تغييرات الحكم: حيث تراوحت نسب التغيير بين 0.0% إلى 21.7% على نموذج CaseHOLD، و30.0% إلى 76.7% على كل من ECHR وSCOTUS، و43.3% إلى 50.0% على ContractNLI.

على الرغم من أن زيادة الحجم ونماذج التحليل القانوني المصممة خصيصاً لم تغلق هذه الفجوة، إلا أن تقييم قوة النموذج وجد أن الامتثال لتعليمات معاكسة ضمن حقائق القضية قد تجاوز حساسية تغيير الحكم بشكل كبير، مع استمراره عبر كل تقييم للنموذج. وبالتالي، يبدو أن ذكر السلطة القانونية يعد مؤشرًا ضعيفًا على اعتماد الحكم عليها، مما يثير تساؤلات حول استخدام التبريرات القانونية المولدة كأدوات امتثال أو تدقيق.

تؤكد هذه النتائج ضرورة اتخاذ الحيطة في الاعتماد على تبريرات نماذج الذكاء الاصطناعي، خاصة في السياقات القانونية. فهل يمكن الوثوق بقرارات الذكاء الاصطناعي في المستقبل؟