بدأت نماذج اللغات الضخمة (LLMs) تُستخدم على نحو متزايد مع التعليمات التي تحدد الأدوار والأساليب والمتطلبات الأمنية، لكن هذه النماذج غالبًا ما تتبع هذه التعليمات بشكل ضمني عبر التعلم من السياق، مما يكون غير كافٍ في حالات التعليمات المعقدة أو التركيبية.
مقدمة SyRuP تأتي لتحل هذه المشكلة، حيث يمثل إطار العمل دراسة متقدمة لتحسين اتباع التعليمات.
يعتمد SyRuP على تطوير رأس مكافأة متقابل لجعل النموذج يتبع التعليمات بطريقة أفضل دون المساس بالنموذج الأساسي. يتم تدريب هذا الرأس اعتمادًا على تفضيلات يحددها النظام، مما يسمح لهم بإنتاج درجات التوافق على مستوى الرموز.
في مرحلة الاستدلال، يقوم SyRuP بإعادة ترتيب أفضل المرشحات من النموذج الأساسي باستخدام إشارات المكافأة المُكتسبة. أظهرت التجارب أن SyRuP يتفوق باستمرار على طرق التعليمات السابقة بتجاوزها الحاجة إلى إعادة ضبط النموذج أو إعادة تقييم الاستجابات، مما يجعل من هذا الأسلوب فعّالاً في التطبيقات الخفيفة.
تجدر الإشارة إلى أن النتائج تشير إلى أن التوجيه الصريح على مستوى الرموز يعد آلية فعّالة وموثوقة لتحسين اتباع التعليمات في أنظمة الذكاء الاصطناعي.
SyRuP: ثورة جديدة في تحسين تقنيات اتباع التعليمات في نماذج اللغات الضخمة!
تمتاز نماذج اللغات الضخمة (LLMs) بقدرتها على الاستجابة للتعليمات مبهمًا. لكن، مع ظهور SyRuP، نقدم لكم إطارًا مبتكرًا لتحسين هذا التفاعل بشكل فعال. دعونا نستكشف كيف يمكن لهذا الطرح تغيير مسار الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
