في عالم الذكاء الاصطناعي المتطور، تبرز أهمية تدريب النماذج عبر استخدام البيانات المناسبة. وفي دراسة جديدة حول "تقييم منهجي لتصفية بيانات المسار لتقنية LoRA"، تطرق الباحثون إلى كيفية تأثير جودة وكمية بيانات المسار على أداء وكالات البرمجة.

تُعتبر عملية التعليم بأوزان مفتوحة لنماذج اللغة الكبيرة (Large Language Models) على تفاصيل خبراء البرمجة تقنية متقدمة تتيح بناء وكالات قادرة دون الاعتماد على نماذج محمية.

تُركز هذه الدراسة بشكل خاص على جودة البيانات ومقدارها كأساس لقياس أداء النماذج. تم إجراء دراسة تجريبية شاملة لتصفية بيانات المسار المستخدمة في تحسين نموذج Qwen2.5-Coder-7B-Instruct، الذي تناول 67,074 مسارًا، منهم 32,161 مسارًا تم حله.

تقترح الدراسة إطارًا لتقييم الجودة يتمحور حول محورين: الكفاءة والأناقة، حيث تم تقييمه عبر 16 تجربة ضابطة تتعلق بالاستراتيجية والحجم وتحليلات الاستبعاد. تكشف النتائج عن توازن حساس بين الجودة والكمية: عندما يتعلق الأمر بالنماذج الصغيرة، فإن مضاعفة حجم البيانات من 500 إلى 1,000 تؤدي إلى تقليل الخسارة بنسبة تقرب من 12.7%.

تعزز هذه النتائج أهمية وجود نظام لتقييم جودة بيانات المسار، مع تقديم بروتوكول تقييم موثق يعكس كيفية تحسين أداء وكالات البرمجة عبر تحليل دقيق للبيانات.