في عالم الذكاء الاصطناعي، تظهر حاجة ملحة لفهم كيفية تعزيز أداء نماذج اللغة (Language Models) من خلال أساليب جديدة ومبتكرة. في دراسة حديثة، تم تناول تأثير النموذج المعتمد على استرجاع البيانات (Retrieval-Augmented Generation، RAG) وكيفية تأثيره على أداء نماذج اللغة، وهو ما يُعتبر تطوراً مهماً في هذا المجال.

تركز الدراسة على تحليل العلاقة بين التعلم المسبق (Pretraining) واسترجاع البيانات، حيث تم استخدام نماذج OLMo-2 التي تتراوح عدد معاييرها من 30 مليون إلى 3 مليار معلمة، وتم تدريبها على ما يصل إلى 100 مليار رمز من بيانات DCLM. تم اختبار قدرة النماذج في مجالات مختلفة مثل التحليل العلمي (Scientific QA) والأسئلة المفتوحة (Open-Domain QA).

تظهر النتائج أن فوائد الاسترجاع تعتمد على سعة النموذج ومدة تعرضه للتعلم المسبق، مما يعني أن مختلفة الأنظمة تتأثر بشكل مختلف. مثلاً، النماذج الأصغر يمكن أن تحقق تحسينات كبيرة في الدقة عندما يتعلق الأمر بالإجابات الصحيحة، ولكن النماذج الأكبر والأكثر تعليماً مسبقاً تحقق مكاسب أكبر في دقة الإجابة.

تُظهر البيانات أن الاسترجاع من معلومات تم التعرف عليها سابقاً يُحافظ على معظم المكاسب المكتسب، مما يعني أن الاسترجاع هو طريقة مكملة للتعلم المعتمد على البيانات، وتعتمد قيمتها على حجم قاعدة البيانات وصلاحية المعلومات الجديدة.

هذا يفتح المجال لفهم كيفية تقسيم البيانات بين التعلم الداخلي والوصول الخارجي عند تصميم نماذج الذكاء الاصطناعي، مما يؤدي إلى تحسين الأداء والنتائج.

ما رأيكم في هذا التطور؟ كيف تتوقعون أن يؤثر ذلك على مستقبل الذكاء الاصطناعي؟