في عالم الذكاء الاصطناعي، أصبحت نماذج اللغة الكبيرة (Large Language Models) تلعب دورًا محوريًا في تشكيل العديد من التطبيقات. ولتسهيل هذه العمليات وتحسين الأداء، تم طرح فكرة جديدة تتعلق بتقنيات التأثير (Influence Functions). تهدف هذه التقنيات إلى فهم كيفية تأثير أمثلة التدريب الفردية على سلوك النماذج.

تتطلب عملية تحليل تأثير بيانات التدريب على سلوك نماذج اللغة الكبيرة حسابات متكررة لتقديرات التأثير، مما يرفع من التكاليف الحاسوبية. من هنا، يبرز الحل وهو إعادة استخدام التدرجات التدريبية المخزّنة، إلا أن تخزين هذه التدرجات الكاملة غالبًا ما يكون مكلفًا للغاية.

تحدث الفريق البحثي عن طريقة جديدة لضغط التدرجات دون فقدان دقة تقديرات التأثير عن البيانات المستقبلية. من خلال تحليل أسوأ الحالات، تم التعرف على الأفضلية للأبعاد الثابتة وتم اقتراح تقنية جديدة تعرف باسم Projection Gradient One-Bit Corrected Eigenbasis (EOGP).

تستفيد تقنية EOGP من أساليب مثل EK-FAC لتقليل الأبعاد، ثم تقوم بتطبيق تقنية تحليل المركبات الرئيسية (PCA) داخل الفضاء المحتفظ به لتعلم اتجاهات الضغط. لاحقًا، يتم استخدام تحويل ثنائي بت لهذه الإحداثيات، مما يسمح بالاحتفاظ بمزيد من الإحداثيات ضمن ميزانية تخزين محددة.

تظهر التجارب على نموذج GPT-2 أن تقنية EOGP تتنبأ بنتائج إعادة التدريب بدقة أعلى من تقنيات الضغط الأخرى، مستخدمةً سدس تكلفة التخزين لكل مثال. في نماذج OLMo 2 SFT التي تتراوح من 1 مليار إلى 32 مليار معلمة، لا تزال EOGP تنافس بقوة على الرغم من تخصيص أكثر من 100 ضعف من التخزين لكل مثال.

تظهر هذه النتائج كيف يمكن للتقنيات الجديدة أن تعزز قدرات نماذج الذكاء الاصطناعي وتقلل من التكاليف، مما يمهد الطريق لمزيد من الابتكارات في هذا المجال. ما رأيكم في هذه التطورات المثيرة؟ شاركونا في التعليقات.