في عالم الذكاء الاصطناعي، يُعتبر تطوير نماذج اللغات الكبيرة (Large Language Models) خطوة بارزة، ولكن التحديات المتعلقة بالنماذج الرياضية تبقى قائمة. في هذا السياق، تُقدم دراسة جديدة تقنية مثيرة تُعرف باسم "التجزئة القائمة على تتبع السياسة" (Trace-Based On-Policy Distillation - TOPD)، والتي تهدف إلى تعزيز قدرات نماذج اللغات الكبيرة في معالجة البيانات الرياضية دون الحاجة لتقدير المكافآت.

تم تصميم طريقة TOPD كإطار تعليمي يشرف على نموذج الدنويز الخاص بنماذج اللغات الكبيرة (dLLMs)، حيث تركز على قرارات الرموز المتعلقة بالمسار الناتج النهائي. تعتمد هذه التقنية على عينة المسارات القائمة على السياسة المحددة من النموذج المستهدف، مما يسمح بالتحديث بناءً على التوزيع الرمزي من نموذج المعلم.

الحقيقة المثيرة تكمن في أن تقنية TOPD تمكن النموذج المعروف باسم SDAR-4B-Chat من تحقيق دقة مشابهة لنموذج TraDo-4B-Instruct الذي تم تدريبه باستخدام التعلم المعزز، مع تسجيل تحسينات تصل إلى +5.7 تحت التقييم الثابت و +4.5 تحت التقييم الدينامي.

الأهم من ذلك، استطاعت تقنية TOPD تحقيق هذه النتائج باستخدام عدد أقل من جولات التفاعل بمقدار 4 مرات، مما يعكس زيادة في سرعة النموذج تصل إلى 96 ضعفًا في مستوى الدقة.

من الواضح أن هذه التقنية تقدم وعودًا هائلة في مسعى لتحسين دقة نماذج الذكاء الاصطناعي، مما يفتح الباب أمام إنجازات جديدة في هذا المجال المتنامي.
هل تعتقد أن هذه الطريقة ستحدث ثورة في الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!