تعتبر نماذج اللغة الكبيرة (Large Language Models - LLMs) من الأدوات الفعّالة في تقييم جودة النصوص، حيث تتجاوز أحياناً المقاييس التقليدية التي تعتمد على النصوص المرجعية. ومع ذلك، فإن هذه النماذج تعاني من ظاهرة تُعرف بالتحيز في التقييم، حيث تُظهر تنبؤات معينة بغض النظر عن سياق النص المُقيم.
في دراسة جديدة نُشرت في arXiv، تم اقتراح طريقة مبتكرة لمعالجة هذا التحيز. حيث يعتمد الأسلوب المُقترح على تعليم النموذج لتوليد رموز رقمية عشوائية، مما يسمح بتحديد التحيز الخفي عبر قياس انحراف التوزيع الملحوظ لأرقام معينة عن التوزيع المتساوي.
تضيف الدراسة تعريفاً لمهمة لاحقة يُستخدم فيها المقيم، وذلك لتوليد أرقام عشوائية تقيس تحيز الأرقام الخاص بالمهمة المحددة. من خلال هذه الطريقة، يتم تصحيح احتمالات توليد الرموز للنموذج بناءً على تحيز الأرقام الخفي.
أظهرت النتائج المستخلصة من التجربة التي شملت أربع مهام مختلفة، بما في ذلك تقييم مواءمة النماذج وتلخيص النصوص، أن الطريقة المُقترحة تتفوق بشكل ملحوظ على الأساليب السابقة، بما في ذلك تلك التي لم تخضع للتعديل والتصحيح. كما أكدت الدراسة على أن التحيز في التقييم يختلف عبر نماذج اللغة ومهامها ومدى التقييم، مما يبرز أهمية قياس التحيز الخفي كحالة شاملة.
كيف يمكن تقليل التحيز في تقييم نماذج اللغة الكبيرة: دراسة جديدة تكشف الأساليب المبتكرة
تستعرض هذه الدراسة الجديدة طرقاً مبتكرة للتقليل من التحيز في تقييم نماذج اللغة الكبيرة عند استخدامها كمقيمين لجودة النصوص. تقدم النتائج أدلة على نجاح الأساليب الجديدة في تحسين دقة التقييمات بشكل كبير.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←# تحيز التقييم# نماذج اللغة الكبيرة# تحسين الأداء# البحث في الذكاء الاصطناعي# توليد الأرقام العشوائية
جاري تحميل التفاعلات...
