بينما يتزايد الاعتماد على نماذج اللغات الضخمة (Large Language Models) في مجالات البرمجة والتطوير، لا يزال هناك جدل حول مدى اعتماد هذه النماذج على الحفظ بدلاً من الفهم العميق. تكشف دراسة حديثة، نشرت على arXiv، أن الطرق المستخدمة لتقييم فعالية الحفظ في هذه النماذج تعاني من نقص كبير في الدقة عند تطبيقها على نطاق واسع.

تمت مراجعة تقنيات الاستكشاف المستخدمة حاليًا، مثل إدخال تغييرات على الرموز أو استخدام تقنيات فحص مختلفة، ووجد أنها تكافح لكشف الحفظ في النماذج الأكبر، حتى عند استخدام نماذج تلوث معروفة. كما أن التقنيات التي تعتمد على احتمالات السجل تعاني من تدهور مماثل.

الأهم من ذلك، توضح الدراسة أن فشل هذه التقنيات في الكشف عن الحفظ قد يكون بسبب كيفية تعامل النماذج الكبيرة مع الحِمل التمثيلي. من خلال تطبيق تحويلات رياضية قابلة للعكس، تمكن الباحثون من عزل هذه العوامل، مما يكشف أن النماذج القابلة للتطوير تستطيع استيعاب حمل تمثيلي كبير مع الحفاظ على الوصول إلى العائلات الصحيحة من الحلول.

إن القدرة على التكيف مع الأشكال السطحية المتغيرة في عالم البرمجة هو ما يهم حقًا من حيث قابليتها للاستخدام والإنتاجية المستقبلية. مع تزايد القلق حول ما إذا كانت الإجابات تم حفظها أم لا، تقدم هذه الدراسة إطارًا جديدًا لفهم كيفية تقييم نماذج اللغات الضخمة في ظل التطورات المستقبلية. يتعين على المستقبل التقني أن يركز على فصل هذه الظواهر بدلاً من الاعتماد على طرق تجلب التعقيد.