إحداث ثورة في التعلم المعزز: نموذج TIPS يجمع بين المخرجات والعمليات بدقة متناهية
تمكن نموذج TIPS من ثورة في طريقة تدريب نماذج جائزة العملية بشكل فعّال، حيث يركز على المخرجات فقط لتحسين النتائج. النموذج الجديد يتجاوز جميع النماذج السابقة في تحقيق الدقة العالية.
تتزايد أهمية نماذج جائزة العملية (Process Reward Models - PRMs) في عالم نماذج اللغات الضخمة (Large Language Models - LLMs) بشكل متسارع. هذه النماذج تساهم في تحسين مستويات التفاعل والتفكير بعد التدريب. ومع ذلك، تظل عملية تدريب نماذج PRMs قوية مكلفة وصعبة؛ حيث أن تعديل الخطوات بواسطة الإنسان يحتاج إلى جهد كبير، والأساليب التقليدية مثل تقدير مونت كارلو (Monte Carlo Estimation) تتطلب موارد حوسبة ضخمة وقد تتسبب في انحراف النتائج. في سعيٍ لتطوير نماذج PRMs فعالة بتكلفة منخفضة، تم تقديم نموذج TIPS (Thinking-Induced Process Supervision) الذي يعتمد على التعلم المعزز بالمخرجات فقط (Outcome-Only Reinforcement Learning - RL). يعتمد هذا الإطار على فكرة أن النموذج يقوم بإنشاء سلسلة من الأفكار (Chain-of-Thought - CoT) تشمل تصنيفات خطوة بخطوة ثم تصنيف نهائي للنتيجة، حيث تعتمد المكافأة فقط على مدى توافق النتيجة المتوقعة مع الحقيقة. استخدمنا النسخة TIPS-Qwen3-4B-Thinking-2507 لنتائج مذهلة حيث حقق النموذج 85.2 F1 في اختبارات ProcessBench باستخدام 3.2K فقط من المسارات المعنونة بالنتائج، متجاوزاً جميع النماذج المدربة الأخرى وأقوى القضاة القائمة على التوجيه مثل GPT-5.4-Instruct وClaude-4.7-Opus. استمتعوا بمسيرة الابتكار والمزيد من التفاصيل المتاحة في الكود والبيانات على [https://github.com/RUCBM/TIPS]. هل تعتقد أن هذه الطريقة ستحدث نقلة نوعية في الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
