بدأت نماذج اللغات الضخمة (LLMs) تُستخدم على نحو متزايد مع التعليمات التي تحدد الأدوار والأساليب والمتطلبات الأمنية، لكن هذه النماذج غالبًا ما تتبع هذه التعليمات بشكل ضمني عبر التعلم من السياق، مما يكون غير كافٍ في حالات التعليمات المعقدة أو التركيبية.

مقدمة SyRuP تأتي لتحل هذه المشكلة، حيث يمثل إطار العمل دراسة متقدمة لتحسين اتباع التعليمات.

يعتمد SyRuP على تطوير رأس مكافأة متقابل لجعل النموذج يتبع التعليمات بطريقة أفضل دون المساس بالنموذج الأساسي. يتم تدريب هذا الرأس اعتمادًا على تفضيلات يحددها النظام، مما يسمح لهم بإنتاج درجات التوافق على مستوى الرموز.

في مرحلة الاستدلال، يقوم SyRuP بإعادة ترتيب أفضل المرشحات من النموذج الأساسي باستخدام إشارات المكافأة المُكتسبة. أظهرت التجارب أن SyRuP يتفوق باستمرار على طرق التعليمات السابقة بتجاوزها الحاجة إلى إعادة ضبط النموذج أو إعادة تقييم الاستجابات، مما يجعل من هذا الأسلوب فعّالاً في التطبيقات الخفيفة.

تجدر الإشارة إلى أن النتائج تشير إلى أن التوجيه الصريح على مستوى الرموز يعد آلية فعّالة وموثوقة لتحسين اتباع التعليمات في أنظمة الذكاء الاصطناعي.