في عالم الذكاء الاصطناعي، تمثل نماذج اللغة (Language Models) واحدة من أهم التطورات التي تشهدها التكنولوجيا، لكن هذه النماذج تواجه صعوبات في الحصول على مكافآت دقيقة تعكس الأداء الفعلي. هنا تأتي تقنية التعلم المعزز المعتمد على المراجعات (Rubric-Based Reinforcement Learning) كوسيلة تدريبية، حيث يقوم الحكم بتقييم نماذج اللغة بناءً على مجموعة من المعايير.
لكن، رغم فعالية هذه المراجعات، فإن طريقة التجميع المستخدمة لتحصيل المكافآت تعتبر نقطة ضعف. تترافق النقاط مع تجميع المعايير، مما يعني أن النماذج يمكن أن تُحقق نقاطًا أعلى من خلال تلبية معايير غير مهمة. في دراسة حديثة، وجد أن نماذج المراجعة هذه تحقق نتائج أفضل في الاستشارة السريرية، لكنها قد تُنتج إجابات أقل جودة.
تقديم حل مبتكر، قدم الباحثون نظام ProRubric، الذي يعمل على تجميع المعايير في أبعاد رئيسية، بحيث يتم احتساب البعد فقط إذا تم استيفاء جميع معاييره. هذا يعني أن الأداء يتم تقييمه بدقة أعلى، مما يؤدي إلى تحسين جودة الإجابات بنسبة 10.8 نقطة.
بفضل هذه التحسينات، حافظ النظام الجديد على فعالية التغطية دون المساومة على دقة الأداء.
لتفاصيل إضافية، يمكنكم الاطلاع على الكود المصدر المتاح على GitHub. ما رأيكم في هذه التطورات المثيرة في عالم الذكاء الاصطناعي؟ شاركونا في التعليقات.
كشف النقاب عن نظام جديد لتحسين التعلم المعزز: كيف تحقق نماذج اللغة أداءً أفضل بدون خداع المكافآت
تمكّن تقنية Rubric-RL الجديدة نماذج اللغة من التعلّم بشكل أكثر دقة، حيث تكشف الدراسات أن طرق التجميع الحالية غير فعالة. يقدم النظام الجديد ProRubric حلاً مبتكرًا لتحسين جودة الإجابات دون فقدان التغطية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
