في الآونة الأخيرة، شهدنا تطورات مذهلة في عالم الذكاء الاصطناعي، وخاصة في تدريب نماذج اللغة الكبيرة (Large Language Models) باستخدام التعلم المعزز (Reinforcement Learning) مع مكافآت قابلية التحقق (Verifiable Rewards). تدل الدراسات الحديثة على أن الرموز عالية الانتروبيا تلعب دوراً بارزاً في تعزيز قدرات الاستدلال لهذه النماذج.

بينما اكتشف الباحثون أن استخدام أعلى 20% من الرموز من حيث الانتروبيا يمكن أن يؤدي إلى تحسينات كبيرة في الأداء، لا تزال هناك أسئلة حول سبب فائدة هذه الرموز. لذلك، قدمت الدراسة الجديدة طريقة مبتكرة تُعرف باسم اختيار الرموز بناءً على مقدار التدرج (Gradient Magnitude-based Token Selection - GMTS).

تستند GMTS إلى ملاحظة أن الرموز التي تحمل الانتروبيا العالية ترتبط بمقدار تدرج كبير، لكن الانتروبيا بمفردها لا تعكس أهمية الرموز عبر إجابات مختلفة. من خلال هذا الأسلوب، يصبح بإمكان الباحثين تحديد أهمية كل رمز بشكل أدق، مما يؤدي إلى تحسينات قابلة للقياس في الأداء.

عند تطبيق GMTS واختيار الرموز العشرون في المئة الأعلى بناءً على الترتيب من حيث مقدار التدرج، تم تحقيق نتائج أفضل بوضوح مقارنةً بالاختيار القائم على الانتروبيا في مجالات استدلال مختلفة وأحجام نماذج متعددة. بفضل هذه الطريقة الجديدة، يمكن أن نشهد تقدمًا هائلًا في قدرة نماذج اللغة على التفكير والاستدلال، مما يعني المزيد من الابتكارات في عالم الذكاء الاصطناعي.

ما هي رؤيتكم حول طريقة GMTS الجديدة؟ هل تتوقعون أن تحدث ثورة في طريقة تدريب نماذج اللغة؟ شاركونا في التعليقات!