في عالم الذكاء الاصطناعي، تُعتبر نماذج اللغات الكبيرة (Large Language Models) محور اهتمام الباحثين، خاصة عندما يتعلق الأمر بإجابة الأسئلة المتعلقة بمجموعات مستندات محدودة. كثيرًا ما تفشل هذه النماذج في استخراج المعلومات المطلوبة عندما لا تتم استرجاع المستندات المصدر في وقت الاستدلال. لذا، أظهرت دراسة حديثة مسارًا جديدًا يحمل اسم تحويل المعرفة الوثائقية (Document Knowledge Internalization)، والذي يهدف إلى تحويل مجموعة ثابتة من الوثائق إلى معرفة بارامترية قابلة للاستخدام في إجابات الأسئلة بدون الحاجة إلى الاسترجاع الفوري.

تقدم الدراسة إطار عمل IAR (الحقن، المحاذاة، والاستعادة)، وهو نموذج يتكون من ثلاث مراحل تفصل بين حقن المعرفة الهيكلية، ومحاذاة سلوك البحث، واستعادة القدرات العامة. تختلف هذه المنهجية عن الأساليب التقليدية للتدريب المستمر، حيث يقوم الحقن بتحويل المستندات المصدر إلى أهداف إعادة كتابة، واستمرار، وهيكل موجه بالتعليمات.

ثم تأتي مرحلة المحاذاة، التي تتكيف مع نموذج الحقن عبر إشراف إجابات فقط، بينما تدمج مرحلة الاستعادة النموذج المتكيف مع النموذج الأساسي لاستعادة القدرات العامة. لقد أظهرت الدراسة أن IAR يُحسن من الحدود العامة والخاصة بالنطاق للنماذج التي تعمل بدون استرجاع الوثائق.

وعبر مقارنات متعددة شملت مجموعات بيانات مختلفة مثل Common Corpus (CC) وCCI، وعلى نطاق نماذج Llama وPhi وQwen وSmolLM، حقق IAR تحسنًا ملحوظًا في الأداء. في 7 من 8 إعدادات مجموعة البيانات والنموذج، حقق IAR متوسط زيادة قدره 3.6 نقطة مئوية في دقة الأسئلة العامة و12.1 نقطة مئوية في الأداء العام عبر معايير IFEval وMMLU وMSBench.

تظهر الأسس المعدلة لـ CC أن طرق LoRA وFAPM يمكن أن تتفوق في معايير معينة، لكن بين الأساليب التي تصل إلى أعلى درجات التحسين في نقل المعرفة، يحتفظ IAR بأحد أقوى الملفات الشخصية العامة.

هذا التطور يمثل نقلة نوعية في كيفية معالجة نماذج الذكاء الاصطناعي للمعلومات المكتوبة، وتفتح الطريق لإمكانيات جديدة في مجال الأبحاث.