في عالم الذكاء الاصطناعي، تعتبر نماذج التعلم الآلي خطوة جوهرية نحو تحقيق تفاعلات أكثر دقة وذكاء. ومن بين هذه النماذج الجديدة يأتي MiCRo (Mixing Contextual Reward Modeling)، الذي يستند إلى نموذج مزيج نمطي ونمذجة السياق لتقديم تجربة تفاعلية مخصصة ومتفهمة.

استندت الأساليب التقليدية لتحديد التفضيلات البشرية على نموذج برادلي-تيري (Bradley-Terry) الذي يفترض وجود دالة مكافأة عالمية. ومع ذلك، تفشل هذه المنهجية في التقاط التنوع الواسع في التفضيلات الإنسانية، مما يحصر قدرة نماذج اللغة الكبيرة (Large Language Models) على دعم التخصيص والتوافق المتعدد. هنا يأتي دور MiCRo الذي يسعى لحل هذه الإشكالية.

يعمل MiCRo على تحسين التعلم الشخصي عبر مرحلتين. في المرحلة الأولى، يتم استخدام نهج نمذجة مزيج السياق لاكتشاف تفضيلات إنسانية متنوعة دون الحاجة إلى تسميات دقيقة. بينما في المرحلة الثانية، تُدمج استراتيجية توجيه عبر الإنترنت، وهي استراتيجية مرنة تتكيف مع السياقات المحددة، مما يسمح بتكييف تفضيلات ذكي وفعال مع الحد الأدنى من الإشراف الإضافي.

تؤكد التجارب التي أجريت على مجموعة من بيانات التفضيلات، أن MiCRo لا ينجح فقط في التقاط التنوع في التفضيلات الإنسانية، بل يحسن أيضًا مستوى التخصيص في التفاعلات المستقبلية بفارق كبير.