في عالم الذكاء الاصطناعي، يبرز نموذج "اللصوص المعتمد على التفضيلات" (Preference-Based Bandits) كمواضيع مثيرة للدراسة والبحث. حيث يركز هذا النموذج على كيفية تحقيق التعلم من خلال تفضيلات المستخدمين بدلاً من التقييمات المطلقة، مما يمكن أن يكون له تطبيقات واسعة في أنظمة التوصيات (Recommender Systems) وترتيب البطولات (Tournament Ranking).


من خلال هذا النموذج، يقوم المتعلم باختيار أزواج من الخيارات (Arms) ويتلقى ملاحظات ثنائية عن التفضيلات التي تحكمها نموذج برادلي-تيري (Bradley-Terry Model). تكمن الصعوبة في التعامل مع الثوابت غير الخطية (Non-linearity) التي تصاحب وظائف الربط، والتي قد تنمو بشكل كبير، مما يُعقد عملية التعلم.


وفي دراستهم، قدم الباحثون مقياس تعقيد جديد يُعرف باسم "أبعاد الإلكترا الحساسة محلياً" (Locally Sensitive Eluder Dimension)، والذي يعمل على تحسين فعالية التعلم من التفضيلات دون الاعتماد السلبي على تلك الثوابت.


ومن خلال تطوير خوارزمية مبتكرة تُدعى GINOP (Generic INformative OPtimism)، يتمكن النظام من إنشاء مجموعات ثقة مستندة إلى الخسائر اللوجستية (Log-loss) وتحديد أزواج الخيارات بطريقة توازن بين التفاؤل (Optimism) والاستكشاف المعلوماتي (Informative Exploration).


وفقًا للنتائج التي توصلوا إليها، أثبت الباحثون أن التعلم من التفضيلات يمكن أن يكون فعالاً إحصائياً كما هو الحال مع التعلم المباشر من الملاحظات. بالإضافة إلى ذلك، تم دعم هذه النتائج النظرية بتقييمات تجريبية مُقارنة بمستويات أساسية تنافسية.


ما هي توقعاتكم حول مستقبل أنظمة التعلم المعتمدة على التفضيلات؟ هل تعتقدون أنها ستكون المستقبل في تطوير أنظمة التوصيات؟ شاركونا آرائكم في التعليقات.