أظهرت الأبحاث الأخيرة أن نماذج Transformers المدربة مسبقًا لا تستفيد بشكل كامل من عمقها في متابعة المرجعيات في السياق. فقد كشفت دراسة جديدة أن ثلاثة عشر نموذجًا أساسيًا يمكنها تتبع عدد قليل من الأسطر، حيث يتراوح هذا العدد بين 1.4 و3.6 خطوط فقط. ورغم استخدام دورات إضافية ما قبل التدريب، لم تحسن النتائج بشكل ملحوظ.

لكن، جاء الحل مبتكرًا! باستخدام LoRA (Low-Rank Adaptation) المدرب على مهام محددة، استطاعت نماذج مثل Qwen3-8B رفع دقتها من 15.5% إلى 99% في تتبع سلاسل من 24 خطًا. والأكثر إثارة أنه يمكن للنموذج تحقيق 50 خطًا مع LoRA المدرب لفترة أطول.

كما أثبت نموذج Ouro-1.4B قدرته على الوصول إلى 60 خطًا بعد أربع دورات من التدريب، لتصل إلى 160 خطًا بعد ثماني دورات. يبدو أن الخوارزمية الجديدة تعيد توجيه الهوية النسبية للخطوط البرمجية عبر نطاق ضيق من الطبقات الوسطى، بينما تستمر رؤوس النموذج المجمدة في قراءة المزيد عبر السلسلة.

من الواضح أن إزالة اهتمام الخط الأم يُوقف العملية، مما يدل على أهمية طبقات التدخل في النتائج. وتحسن نماذج LoRA المخصصة يؤكد أن الاستجابة الافتراضية لا تعكس فعلاً القدرة على الحساب الميسرة من خلال تعديل بسيط. للمزيد من التفاصيل، يمكنكم زيارة www.lunamos.github.io/stop-thinking-too-early.

ما رأيكم في هذا التطور الرائع؟ شاركونا في التعليقات.