في عالم الذكاء الاصطناعي، تُعد تحسين النماذج (Fine-tuning) واحدة من أهم المجالات للنقاش والبحث. يعمل الباحثون على استخدام تقنيات ما بعد التدريب مثل تحسين التعلم المراقب (Supervised Finetuning - SFT) وتعلم التعزيز (Reinforcement Learning - RL) لتحقيق أقصى استفادة من نماذج التعلم العميق. لكن ما الذي يجعل SFT مثيرًا هذه الأيام؟ الفكرة الجديدة تعتمد على استغلال قوة تعلم العينات.

تبدو الأبجديات التقليدية في هذا المجال متعارضة؛ إذ يُعتقد أن تعلم التعزيز يعزز التعميم القوي للمهام الجديدة دون فقدان القدرات الحالية. بينما تعتمد SFT على البيانات من خبراء في معرفة الأمور الأخرى، مما يجعلها أكثر مرونة. لكن، كيف يمكن الاستفادة من هذه البيانات بطرق أفضل؟

نقدم في بحثنا خوارزمية جديدة لتقنية العينات، تعتمد على سلسلة ماركوف مونت كارلو (Markov Chain Monte Carlo - MCMC). هذه الخوارزمية تقوم بتعديل عينات البيانات غير المُعتمدة لتناسب ما يُعرف بالنموذج المرجعي، مما يعزز تعلم SFT ليصبح قريبًا من تقديم الخدمات المثلى. وقد أظهرت نتائجها في مهام مثل اكتساب المهارات العلمية والتفكير الرياضي، قدرة SFT على التنافس مع تقنيات ما بعد التدريب الرائجة، حيث حقق التعميم بشكل أفضل ونسى أقل من أسس التعلم القديمة.

تتجاوز النماذج المحسنة الجديدة مجرد صقل النماذج الأساسية. إنها تعرض منهجاً جديداً لرؤية البيانات كعمل نموذج محلي يمكن من تشكيل البيانات لفرص تعلمية أكبر، مما يفتح آفاقاً جديدة لاستخدامات عامة في أنظمة ما بعد التدريب.