تشهد أبحاث الذكاء الاصطناعي تقدماً كبيراً مع تقديم إطار عمل مبتكر يُعرف ب"نقل الائتمان القائم على الحسابات" (Computation-Conditioned Credit Transport - CCT)، الذي يُعتبر خطوة عملاقة نحو تحسين أداء نماذج اللغات الضخمة (Large Language Models - LLM) في مجال التعلم المعزز (Reinforcement Learning - RL).
في التعليمات السابقة، تم تقسيم مهمة تعيين الائتمان إلى ثلاث عناصر رئيسية: الأدلة حول النجاح، وعامل النقل الذي يحول هذه الأدلة إلى مزايا على مستوى الرموز، والهندسة التحديثية التي تحوّل المزايا إلى تغييرات في السياسات. رغم التحسينات الملحوظة في عنصر الأدلة والهندسة التحديثية، ظلت نماذج النقل بلا ارتباط ببنية النموذج.
يقدم الإطار CCT طريقة جديدة حيث يتم معالجة إحصائية مفصولة من حسابات السياسة السلوكية لتخصيص نواة سببية تنقل القيمة إلى الجوانب السفلية للخلية من خلال مسار الإطلاق.
بفضل الخوارزمية المجسدة، المعروفة باسم CompPO، يتم التركيز على انتباه الرموز من خلال بوابة حفظ محدودة تُستخدم في تحديثات مكافآت المهام وأهداف السياسة، مما يعزز الأداء دون الحاجة لنموذج ثانٍ من "ترانسفورمر" (Transformer) بنفس الحجم.
أظهرت الاختبارات أن CompPO تُمكن النماذج من تحقيق 61.4% دقة محجوزة في خمسة تجارب على Qwen3-4B، متفوقة على الأداء السابق البالغ 53.8%. ويساهم أيضًا في تحسين النتائج بنسبة تصل إلى 4.3 نقاط عبر تقييم GPR و3.9 نقطة على إعدادات أخرى.
إن هذه النتائج لا تدل فقط على قوة هذا الإطار الجديد، بل تعكس أيضًا الاتجاه المتنامي نحو استخدام الأدوات الأكثر تعقيداً لتحسين التعلم في نماذج اللغات الضخمة.
**ما رأيكم في هذا التطور الجديد في عالم الذكاء الاصطناعي؟ شاركونا في التعليقات!**
ثورة في تعلم الآلة: النقل الذكي للائتمان في نماذج اللغات الضخمة
تقدم دراسة جديدة إطار عمل مبتكر يسمى نقل الائتمان القائم على الحسابات، مما يحسن من كفاءة نماذج اللغات الضخمة في التعلم المعزز. يمكن أن يصل الأداء إلى دقة أعلى بنسبة 61.4%.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
