في عالم الذكاء الاصطناعي، تتوالى الابتكارات بشكل متسارع، ولعل واحدة من أكثر التطورات إثارة هي تقطير النماذج اللغوية الكبيرة (Large Language Models) باستخدام نهج جديد تحت مسمى "On-policy Distillation". هذه الطريقة تجمع بين التدريب الذاتي للنموذج وبيانات إشراف دقيقة من المعلم.

في دراسة حديثة، تم تناول دور بيانات التدريب بشكل عميق، حيث استخدم الباحثون مجموعة بيانات واحدة فقط لدراسة فعالية التدريب. وقد أظهرت النتائج أن تدريب "One-shot OPD" لا يتوقف عند حد معين، بل يستمر في التحسن لعدة خطوات، مما يحقق أغلب مكاسب التقنيات التقليدية في مجالات متعددة.

تستند هذه الدراسة على فكرة "تغطية الحالة"، وهي النسبة المئوية للحالات التي تم التعرض لها خلال تدريب النموذج. حيث أظهرت النتائج أن نموذج التدريب على استعلام واحد يمكنه الوصول إلى نسبة "71.5%" من حالة بيانات التدريب كاملة، وخاصة في الخطوات الأولى من التدريب. إضافة استفسارات ذات دلالات متميزة تُعزز التغطية ودقة التحقق حتى يصل العدد إلى 16 استفساراً، مما يُحقق نسبة "98.9%" من التأثير المرتبط ببيانات التدريب الكاملة.

لكن، رغم هذه الإنجازات، تبين أن النماذج تعاني من قلة الكفاءة في آليات التدريب. فبينما تُظهر النتائج تغطية واسعة، فإن عملية الامتصاص للمعلومات تتطلب وقتاً طويلاً. وهذا يدعو للتمعن في كيفية إعادة التفكير في الأساليب المستخدمة لتعزيز خطوة فعالية "On-policy Distillation"، مما يشجع العلماء على دراسة مستقبل هذه الطرق في سياق تحسينات ما بعد التدريب.

هذا التطور يرسم آفاقاً جديدة للبحث، ويضع أساساً لاستراتيجيات جديدة لتقنية الذكاء الاصطناعي من خلال الاستفادة المثلى من البيانات المتاحة. ما رأيكم في هذه الاستراتيجية الجديدة؟ شاركونا في التعليقات.