في عالم الذكاء الاصطناعي، يُعتبر تطوير نماذج اللغات الكبيرة (Large Language Models) خطوة بارزة، ولكن التحديات المتعلقة بالنماذج الرياضية تبقى قائمة. في هذا السياق، تُقدم دراسة جديدة تقنية مثيرة تُعرف باسم "التجزئة القائمة على تتبع السياسة" (Trace-Based On-Policy Distillation - TOPD)، والتي تهدف إلى تعزيز قدرات نماذج اللغات الكبيرة في معالجة البيانات الرياضية دون الحاجة لتقدير المكافآت.
تم تصميم طريقة TOPD كإطار تعليمي يشرف على نموذج الدنويز الخاص بنماذج اللغات الكبيرة (dLLMs)، حيث تركز على قرارات الرموز المتعلقة بالمسار الناتج النهائي. تعتمد هذه التقنية على عينة المسارات القائمة على السياسة المحددة من النموذج المستهدف، مما يسمح بالتحديث بناءً على التوزيع الرمزي من نموذج المعلم.
الحقيقة المثيرة تكمن في أن تقنية TOPD تمكن النموذج المعروف باسم SDAR-4B-Chat من تحقيق دقة مشابهة لنموذج TraDo-4B-Instruct الذي تم تدريبه باستخدام التعلم المعزز، مع تسجيل تحسينات تصل إلى +5.7 تحت التقييم الثابت و +4.5 تحت التقييم الدينامي.
الأهم من ذلك، استطاعت تقنية TOPD تحقيق هذه النتائج باستخدام عدد أقل من جولات التفاعل بمقدار 4 مرات، مما يعكس زيادة في سرعة النموذج تصل إلى 96 ضعفًا في مستوى الدقة.
من الواضح أن هذه التقنية تقدم وعودًا هائلة في مسعى لتحسين دقة نماذج الذكاء الاصطناعي، مما يفتح الباب أمام إنجازات جديدة في هذا المجال المتنامي.
هل تعتقد أن هذه الطريقة ستحدث ثورة في الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!
تقدم جديد في الذكاء الاصطناعي: تقنية رسمية لتسريع نماذج اللغات عبر التجزئة الذكية!
تكشف تقنية جديدة تُعرف باسم "التجزئة القائمة على تتبع السياسة" عن إمكانيات مثيرة لنماذج اللغات الكبيرة في معالجة الرياضيات. هذه الأساليب تعد بتوفير دقة رائدة وفعالية كبيرة مقارنة بالطُرق التقليدية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
