في عالم الذكاء الاصطناعي، يعد التقييم الدقيق للنماذج أحد أهم الجوانب لضمان فعاليتها وأدائها. مؤخرًا، تم الإعلان عن تقنية مبتكرة تُعرف بـ Graph-Structured Rubrics (GSR)، والتي تعدّ ثورة في كيفية استخدام المعايير (rubrics) لتقييم نماذج اللغات الضخمة (Large Language Models).

تقليديًا، كان المعلمون والمقيّمون يعتمدون على معايير ثابتة قد تبدو فقط كقوائم مستقيمة دون توضيح كيفية تفاعل هذه المعايير للاستنتاجات النهائية. لكن GSR تقدم طريقة جديدة لتجميع هذه المعايير في رسوم بيانية هيكلية، مما يجعل عملية التقييم أكثر تفاعلية ودقة.

تعمل GSR عن طريق إنشاء رسومات بيانية تقييمية مستقلة عن الاستجابات. حيث يتم جمع المعايير والأحكام من خلال نقاط مسماة (named ports) فيما يعرف بعملية الإخراج (Readout) التي تحول الناتج الفريد إلى درجة أو تفضيل. ومع ذلك، يتم رفض الرسوم البيانية غير الصالحة أو غير المتوافقة من حيث النوع، مما يضمن جودة العملية.

تظهر نتائج الاختبارات تحت نموذج GPT-OSS-120B تحسنًا ملحوظًا في دقة التقييم، حيث ارتفعت نسبة التوافق بين التقييمات بمعدل يتراوح بين 0.62 إلى 6.75 نقطة مئوية مقارنة بأسلوب 'Prometheus' على أربعة مجموعات بيانات في التقييم النقطي. علاوة على ذلك، نجحت GSR في تحقيق أعلى دقة زوجية في الاختبارات باستخدام سياسات الامتناع والتعادل الأصلية على مقياسين تفضيليين.

في الختام، يمكن لتقنية GSR أن تُحدث تغييرًا جذريًا في كيفية تقييم واختبار نماذج الذكاء الاصطناعي. كم تُتوقع أن تُحدث من تأثيرات أخرى في المستقبل؟ ما رأيكم في هذا التطور؟ شاركونا في التعليقات!