في عالم الذكاء الاصطناعي، تُعَدّ دراسة تحسين التفضيلات (preference optimization) من المجالات المبتكرة التي تسعى لتطوير قدرات النماذج في فهم واستجابة تفضيلات المستخدمين. لكن ماذا لو أخبرتك أن استخدام مجموعة بيانات صغيرة وعالية الثقة يمكن أن يكون أكثر فعالية من الاعتماد على كميات هائلة من البيانات؟

تقدم دراسة جديدة نُشرت في arXiv تحت عنوان "تقنية DMAPO: اتفاق متعدد التقييمات المركّز على البيانات لتحسين التفضيلات" نهجاً ثورياً. حيث اقترح الباحثون في هذه الدراسة تقنية DMAPO (Data-centric Multi-evaluator Agreement for Preference Optimization) التي تعتمد على تقييم سلسلة من الاستجابات الناتجة عن السياسة المستهدفة، وذلك لتحديد مدى فائدة هذه الاستجابات وإمكانية اعتمادها.

كيف تعمل التقنية؟
إذاً، تبدأ الطريقة بجمع ردود الأنظمة المستهدفة، ثم تُقيم هذه الردود بناءً على عدة معايير مثل السهولة والفائدة والدقة باستخدام مقيمين متخصصين. ولضمان وجود توافق عالٍ بين الآراء، يتم الاحتفاظ فقط بالأمثلة التي تُظهر توافقاً عالياً سواء كانت مُرغوبة أم غير مرغوبة. من بين 54,236 رد من نموذج Mistral-7B، تم قبول 1,871 منها، وهو ما يُمثل 3.45% فقط.

النتائج كانت مثيرة للاهتمام، حيث أظهر نموذج KTO الذي تم تدريبه اعتماداً على هذه المجموعة، أداءً مثيراً بتسجيل 7.50 على مقياس MT-Bench ونسبة فوز 95.5% ضد نموذج text-davinci-003. كما تقدم DMAPO أداءً أفضل من نموذج SimPO وفقاً لتقييم مستقل، حيث حققت النماذج معدلات فوز كبيرة على مجموعات بيانات مختلفة.

تعتبر هذه النتائج خطوة مهمة نحو تحسين الكفاءة في عملية تدريب نماذج الذكاء الاصطناعي، مُظهرة إمكانية استخدام كميات قليلة من البيانات بشكل فعال، لكن مع تكلفة إضافية تتعلق بالتحقق والتقييم.

فما رأيكم في استخدام بيانات أقل لتحقيق نتائج أفضل في تحسين تفضيلات النماذج؟ شاركونا آرائكم في التعليقات.