في عالم نماذج اللغات الضخمة (Large Language Models)، تتعدد طرق تقييم الإجابات باستخدام قوائم متدرجة من المعايير. ومع ذلك، تواجه هذه النماذج تحديًا كبيرًا وهو 'تداخل المعايير'، حيث تؤثر أحكام معيار واحد على أحكام المعايير الأخرى. وذلك يعني أن الاحكام قد تختلف بناءً على تركيبة المعايير المعتمدة أثناء التقييم.

في دراسة أولية، وُجد أن ثلث العيّنات فقط حصلت على أحكام متناسقة تمامًا عند تقييمها ضمن مجموعات مختلفة من المعايير. وقد أظهرت الأبحاث الحالية ضرورة تطوير إطار قياس لفهم هذا التداخل وكيفية التعامل معه. هذه العملية تتطلب أربع عمليات تحكم: توسيع مجموعة المعايير، والتحكم في مكوناتها، وإعادة ترتيبها، وإدخال الضوضاء.

للتغلب على هذا التداخل دون الاعتماد على إشراف خارجي، تم اقتراح تقنية 'محاذاة المعايير الذاتية' (SARA)، التي تعتمد على إرساء أحكام المعيار الواحد كنقاط مرجعية مستقرة. تعتمد SARA على توجيه التفكير متعدد المعايير وفقًا لهذه النقاط المرجعية باستخدام تقنية 'الاستخلاص الذاتي' (self-distillation) في ظل السياسة المعتمدة.

لقد تم التحقق من فعالية SARA على ثلاثة مجموعات بيانات رئيسية: HealthBench، FLASK، وResearchQA، وعلى فئتين من النماذج: Qwen3 وLlama-3.1. وأظهرت النتائج أن SARA تحسن الاتساق في التقييم بشكل مستمر كما تعزز الاتفاق بين النماذج الأساسية وGPT-4.1 كحكم مرجعي. بالإضافة إلى ذلك، أثبتت SARA أنها تعلّم قدرة عامة على الاتساق لا تقتصر على أنماط محددة، بل تنتقل عبر مجموعات البيانات المختلفة.

هل تعتقد أن هذه التطورات في تقييم نماذج الذكاء الاصطناعي ستؤثر على تطبيقات الذكاء الاصطناعي في المستقبل؟ شاركونا بآرائكم!