في ظل النمو المذهل لنماذج اللغات الضخمة (Large Language Models) ودورها المتزايد في الوساطة القانونية حول حقوق الإنسان، يستدعي الأمر ضرورة تقييم فعاليتها في فهم وتطبيق حقوق الإنسان بشكل صحيح. ومع عدم وجود معيار تقييم موثوق حتى الآن، بدأت مجموعة من الباحثين في تطوير HumRightsBench، وهو معيار مبتكر يقوم على السيناريوهات ويخضع لمراجعة الخبراء، لتقييم مدى قدرة هذه النماذج على استخلاص القرارات القانونية المتعلقة بحقوق الإنسان.
تعتمد هذه المنهجية على إطار IRAC المعروف في التفكير القانوني، مع تعديل بسيط ليصبح IRAP، حيث تم استبدال "اقتراح الحلول" بـ"الاستنتاج القانوني"، مما يتناسب بشكل أفضل مع أنماط التفكير المميزة في قضايا حقوق الإنسان.
تم إنتاج سلسلة تجريبية من السيناريوهات الواقعية، والتي تتناول البعد المتعدد لقضايا حقوق الإنسان، وتم استخدام ملاحظات من حقوقيين محترفين حول العالم لتطوير هذا المعيار.
تشير النتائج الأولية إلى أن دقة النماذج تختلف بشكل ملحوظ عبر المهام القانونية، حيث يتراوح الأداء العام بين 0.339 و 0.577، مما يعكس الإمكانيات الكبيرة لمعيار HumRightsBench كأداة متقدمة في تقييم الذكاء الاصطناعي في هذا المجال الحيوي.
خطوة نحو معيار حقوق الإنسان لنماذج اللغات الضخمة: منهجية مبتكرة للتقييم
تسعى الدراسة الجديدة إلى تطوير معيار مبتكر يُعرف بـ HumRightsBench، يُمكن من تقييم نماذج اللغات الضخمة (LLMs) في سياق حقوق الإنسان. تؤكد النتائج الأولية أن الأداء يختلف بشكل كبير، مما يفتح آفاقاً جديدة في هذا المجال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
