تشير الأبحاث الأخيرة إلى أن خوارزميات التوافق المباشر (Direct Alignment Algorithms) مثل DPO أصبحت وسيلة شائعة لتدريب نماذج اللغة الضخمة (Large Language Models) لكي تتماشى مع تفضيلات البشر. ومع ذلك، لوحظ أن هذه الخوارزميات قد تؤدي إلى تحسين مفرط لنموذج المكافآت الضمني، مما يقلل من احتمالية الحصول على استجابات مفضلة.

هذا التحسن المفرط قد يؤدي إلى تراجع الاحتمالية الكلية المُعطاة للاستجابات في مجموعة البيانات الخاصة بالتفضيلات، مما ينجم عنه سلوكيات غير مرغوبة. **كيف يمكن مواجهة هذا التحدي؟**

لدراسة هذا الجانب، قمنا بفحص تأثير استخدام أهداف تتضمن مًصطلح تنظيم للحفاظ على الطول الإجمالي المُعتاد للاحتمالات الخاصة بالاستجابات المُختارة والمرفوضة.

تطرقنا للبحث في كيفية توزيع تغييرات احتمالية الاستجابة في وجود أو عدم وجود تنظيم. وقد توصلنا إلى أن جزءًا كبيرًا من هذه التغييرات كان نتيجة لمجموعة صغيرة من الرموز المميزة، مما يفسر كيف يمكن لخوارزميات التوافق المباشر تحسين جودة التوليد رغم انخفاض احتمالات الاستجابات المفضلة.

قمنا بتطبيق التنظيم المقترح على طريقتين: الطريقة المرجعية (DPO) والطريقة غير المرجعية (SimPO)، ووجدنا أن هذا التنظيم مُحسن بشكل كبير من التوازن بين جودة الاستجابة وقدرة التقييم العام، إلى جانب تحسينات ملحوظة في نمذجة المكافآت عبر مجموعات البيانات.

على سبيل المثال، عند استخدام Llama-3.1-8B-Instruct، لوحظ زيادة نسبتها أكثر من 20% في نتائج AlpacaEval2 و9% في تحسين الأداء على المعايير العامة.

تحمل هذه الدراسة تطلعات جديدة للذكاء الاصطناعي في سبيل الإيفاء بالتفضيلات الإنسانية وتحسين جودة الاستجابة، مما يثير تساؤلات حول مستقبل تلك التقنيات الذكية.

ما رأيكم في هذا التطور؟ شاركونا آراءكم في التعليقات!