في عالم الذكاء الاصطناعي، تمثل تقنية الاستخلاص الذاتي (Self-Distillation) واحدة من أهم أدوات تحسين نماذج اللغات. دراسة جديدة تم طرحها على منصة arXiv تكشف عن جوانب مثيرة في هذا المجال، حيث تتناول كيفية التعامل مع المعلومات من خلال نماذج مجهزة بسياقات خاصة.

توضح الدراسة كيفية اختلاف الطرق الحالية لاستخلاص المعلومات على ثلاثة محاور متشابكة:
1. **مصدر التنفيذ** (Rollout source): هل هو نموذج الطالب (Student) أم المعلم (Teacher)؟
2. **ترابط المعلم** (Teacher coupling): هل المعلم ثابت، أم يتم استخدام متوسط متحرك لنموذج الطالب بمعدل ربط معين؟
3. **اتجاه KL** (KL direction): هل نحن نتجه للخلف أم للأمام؟

يُظهر الباحثون أن هذه المحاور تُدرس عادةً في تركيبات ثابتة، مما أدى إلى استنتاجات متضاربة حولها. من خلال تطوير إطار موحد يتناول جميع تقنيات الاستخلاص الذاتي، مقارنة بـ *التدريب الخاضع للإشراف (Supervised Fine-Tuning)*، تم إجراء 1200 جولة تدريبية على نماذج متعددة مثل Qwen2.5-7B وMinistral-3-3B عبر مهام عادية ومتضاربة.

من خلال هذه الجولات، توصل الباحثون إلى عدة نتائج هامة:
- أولا، مصدر التنفيذ يؤثر بشكل رئيسي في الحالات التي تتعارض مع سلوك النموذج المدرب مسبقاً: في مثل هذه الحالات، يزيد استخدام نموذج المعلم من الاكتساب كثيراً مقارنة بنموذج الطالب، مع تغيير ضئيل في الاحتفاظ.
- ثانياً، تغير ترابط المعلم يؤثر بشكل كبير على الاكتساب عبر جميع المهام: ينمو الاكتساب مع معدل الربط، ثم يتراجع بعد تجاوز معدل ربط محدد.
- ثالثاً، يؤدي تغيير اتجاه KL إلى تكاليف في الاحتفاظ في نموذج واحد ولكن ليس الآخر، مما يعني أن أي محور يجب تحسينه أولاً يعتمد على النموذج ذاته.

تتضمن الدراسة نموذجاً محكماً يمكنه تمثيل هذه الاتجاهات الثلاثة، مما يتيح للباحثين فرصة فريدة لفهم سلوك نماذج الأذكياء عند تدريبها.

كل هذه المعلومات تعكس أهمية التفكير العميق في كيفية تحسين تقنيات الاستخلاص الذاتي، مما يفتح باباً نحو تحسين نماذج الذكاء الاصطناعي بشكل كبير.

ما رأيكم في هذا التطور؟ شاركونا في التعليقات!