تعتبر نماذج اللغة الكبيرة (Large Language Models) من أحدث الابتكارات في مجال الذكاء الاصطناعي، حيث تمتلك القدرة على التكيف مع مجموعة متنوعة من الاستخدامات. ومع ذلك، فإن عملية التخصيص من خلال التدريب الخاضع للإشراف (Supervised Fine-Tuning) قد تؤدي في بعض الأحيان إلى فقدان هذه النماذج لقدراتها العامة، مما يُحدث صعوبة في التعامل مع استفسارات تتطلب مستوىً عالياً من التخصص.
لذلك، ظهر أسلوب جديد يُعرف باسم SFT-as-context، والذي لا يتطلب تدريباً إضافياً، حيث يعتمد على استخدام استجابة نموذج التخصيص كمرجع للإجابة على الاستفسارات. هذا يتيح للنموذج الأم الاستفادة من القدرات المتخصصة دون التضحية بالمهارات العامة التي يمتلكها.
أظهرت التجارب عبر 19 زوجاً من النماذج الأم والنماذج الخاصة و11 معياراً أن SFT-as-context يحقق نتائج قريبة جداً من نماذج التخصيص التقليدية، حيث لم تتجاوز الفجوات سوى 2.2 نقطة مئوية في بعض المعايير. والأهم من ذلك، يمكن لهذا الأسلوب أن يحل الاستفسارات التي تتطلب كل من القدرات المتخصصة والعامة، حتى عندما لا تنجح أي من النماذج المعنية بمفردها.
علاوة على ذلك، يتجاوز هذا النهج حدود الأزواج التقليدية؛ فقد أظهرت الأبحاث أن استجابات نموذج SFT مفتوح المصدر يمكن أن تعزز من أداء نماذج مغلقة المصدر قوية، مما يجعله حلاً غير تقليدي للنماذج التي لم تكن فعالة بمفردها.
في سياق آخر، استُخدم إطار بايزي للحصول على ضمانات نظرية تحدد مستوى الخطأ في SFT-as-context بالنسبة لنموذج SFT من جهة، وللنموذج الأم من جهة أخرى. وبدلاً من ذلك، تبين أن النموذج الأم يميل إلى التركيز على الاستجابات المفيدة من نموذج SFT، مما يشير إلى أن الانتباه الانتقائي يسهم في تحسين الأداء عبر التعلم في السياق.
تجاوز الذاكرة: كيف يحسن SFT-as-Context القدرات الفائقة لنماذج اللغة الكبيرة!
يقدم البحث الجديد أسلوب SFT-as-context الذي يمكّن النماذج اللغوية الكبيرة من الاحتفاظ بقدراتها العامة أثناء الاستفادة من قدرات المتطلبات المتخصصة. استعدوا لاكتشاف المزيد حول هذه التقنية المثيرة ونتائجها المذهلة!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
