في عالم الذكاء الاصطناعي، تمثل نماذج اللغة (Language Models) واحدة من أهم التطورات التي تشهدها التكنولوجيا، لكن هذه النماذج تواجه صعوبات في الحصول على مكافآت دقيقة تعكس الأداء الفعلي. هنا تأتي تقنية التعلم المعزز المعتمد على المراجعات (Rubric-Based Reinforcement Learning) كوسيلة تدريبية، حيث يقوم الحكم بتقييم نماذج اللغة بناءً على مجموعة من المعايير.

لكن، رغم فعالية هذه المراجعات، فإن طريقة التجميع المستخدمة لتحصيل المكافآت تعتبر نقطة ضعف. تترافق النقاط مع تجميع المعايير، مما يعني أن النماذج يمكن أن تُحقق نقاطًا أعلى من خلال تلبية معايير غير مهمة. في دراسة حديثة، وجد أن نماذج المراجعة هذه تحقق نتائج أفضل في الاستشارة السريرية، لكنها قد تُنتج إجابات أقل جودة.

تقديم حل مبتكر، قدم الباحثون نظام ProRubric، الذي يعمل على تجميع المعايير في أبعاد رئيسية، بحيث يتم احتساب البعد فقط إذا تم استيفاء جميع معاييره. هذا يعني أن الأداء يتم تقييمه بدقة أعلى، مما يؤدي إلى تحسين جودة الإجابات بنسبة 10.8 نقطة.

بفضل هذه التحسينات، حافظ النظام الجديد على فعالية التغطية دون المساومة على دقة الأداء.

لتفاصيل إضافية، يمكنكم الاطلاع على الكود المصدر المتاح على GitHub. ما رأيكم في هذه التطورات المثيرة في عالم الذكاء الاصطناعي؟ شاركونا في التعليقات.