في عالم الذكاء الاصطناعي، تتزايد حاجة نماذج اللغة (Language Models) إلى فهم اتجاهات طويلة ومعقدة في البيانات. تأتي أحدث الابتكارات في هذا المجال عبر مشروع OctoLong، الذي يمثل تحولًا حقيقيًا في طرق تدريب نماذج اللغة على سياقات برمجية طويلة.

تعتمد نماذج اللغة الحالية بشكل رئيسي على مجموعات بيانات تتضمن كتبًا ومقالات أكاديمية ومخازن شفرة، وهي موارد محدودة غالبًا ما تعاني من نقص في التبعيات الطويلة. هنا يأتي دور OctoLong.

يقدم OctoLong خط أنابيب هندسة سياق مبتكر يجمع بين أدوات تحليل الشجرة التركيبية (AST parser) وسيرفر لغوي ولغات برمجة لإمكانية استرجاع مراجع الشفرة بشكل تكراري. هذا النظام يمكّن من تجميع سياقات غنية بالتبعيات يصل طولها إلى ملايين الرموز.

ما يميز OctoLong هو نموذج OctoLong-Instruct، مجموعة من نماذج اللغة المفتوحة القوية التي تمتد في حجمها من 600 مليون إلى 14 مليار معلمة. تمت عملية تدريب هذه النماذج من خلال إدخال بيانات OctoLong عبر مجموعة مكونة من حوالي 50 مليار رمز.

تظهر التجارب التي أجريت أن استبدال 12% فقط من البيانات التقليدية لـنموذج اللغة الطويلة بـ بيانات OctoLong يحقق مكاسب ملحوظة في فهم الشفرة على مستوى المستودعات، وتتبع الحالة طويلة المدى، بالإضافة إلى تحسين استخدام واجهة برمجة التطبيقات في سيناريوهات البرمجة القصيرة. إن هذا الابتكار يعد بمثابة نقلة نوعية تمنح المطورين أدوات أكثر فعالية لفهم سياقات برمجية معقدة.