في عالم الذكاء الاصطناعي المتسارع، أثبتت الدراسات الأخيرة أن نماذج اللغة الكبيرة (LLMs) يمكنها تحسين نتائجها بشكل تدريجي من خلال دمج عينات تم إنشاؤها مع درجات تقييمها كأمثلة داخل السياق. وعلى الرغم من هذه النتائج التجريبية المثيرة، إلا أن الأسس النظرية وراء هذا الظاهرة لا تزال غير مفهومة بما فيه الكفاية.

هذا المقال يبحث في كيفية ارتباط "التعلم داخل السياق المعتمد على الدرجات" (score-conditioned In-Context Learning) بأساليب تحسين السياسات. حيث نقدم دليلاً بنيوياً يوضح أن آليات الانتباه الذاتي يمكن أن تُطبق تجميعات مخصصة تعتمد على المكافآت بطريقة تشبه خوارزمية "REINFORCE"، شريطة وجود تكوينات معينة لمصفوفة الأوزان.

سوف يتم مناقشة العلاقة بين هذا البناء وسلوك المحولات المدربة مسبقًا، موضحين كيف أن الرابطة بين الحالة الخفية ومجال الأوزان تقدم تحليلات دقيقة. وباستخدام نموذج الحالة الخفية المبسط، تم كشف حدود عليا دقيقة حول تغيير التوزيع الناتج من تحديث انتباه مقيد، والذي يقارب فكرة تحسين السياسات المقيدة بواسطة KL.

لقد تم التحقق من نظريتنا من خلال تجارب مكثفة عبر عدة نماذج لغوية كبيرة، مما يُظهر أن هذه النماذج تستخدم معلومات الدرجات بشكل فعّال لتحريك توزيع النتائج نحو العينات ذات الدرجات العالية. كما أظهرت الأوزان الخاصة بالانتباه ارتباطاً قوياً مع درجات الأمثلة المستندة إليها.