في سعيهم المستمر لتطوير نماذج التعلم الآلي، قام الباحثون بتقديم تقنية HiFloat4 (HiF4) التي تعد الأولى من نوعها التي تستخدم التعلم المعزز (Reinforcement Learning) بدقة 4 بت. هذا الإنجاز يفتح آفاقًا جديدة في عالم الذكاء الاصطناعي، حيث تتم معالجة كل من سياسات التدريب والتنفيذ بشكل فعال للغاية.

تظهر النتائج الأولية للدراسة أن المصدر الرئيسي للتدهور في أداء نماذج FP4 (4-bit Precision) ليس الأخطاء الناتجة عن عملية التدريب، بل من تكميم تفعيل التفاعل (activation quantization) الذي يحدث خلال عملية التنفيذ. حيث تمتد القيم الخارجة عن المألوف إلى نطاق ديناميكي كبير، مما يجعل العديد من القيم تحتفل إلى الصفر.

ومع ذلك، يكشف البحث أيضًا عن أن استعادة سياسة التدريب بدقة أعلى مع الحفاظ على عملية التنفيذ FP4 يمكن أن يؤدي إلى انخفاض في دقة النموذج بدلاً من تحسينها، مما يحكم على فكرة الإصلاحات التقليدية. لذا، تم اقتراح تقنية Rollout Residual Quantization (Rollout-ResQ)، وهي مصحح بسيط مضاف إلى المعاملات الاستدلالية، غير مكلف من حيث الموارد، يساعد في التعويض عن معظم الفقد في الدقة الناتج عن انخفاض القياسات.

عند تطبيق هذه التقنيات على نماذج Qwen2.5-3B و Qwen2.5-Math-7B، نجحت Rollout-ResQ بشكل مدهش في تقليص الفجوة في الدقة بين FP4 و BF16 من 4.9% إلى 1.1%. كما أظهرت التجارب أن استخدام تنسيق MXFP4 ساعد في تقليل الفجوة من 13.6% إلى 5.3%، ليؤكد أن اختيار تنسيق FP4 يعد عاملاً رئيسيًا في تحقيق دقة قابلة للاسترجاع.

بفضل هذه النتائج، تُعزز HiF4 كتنسيق أساسي لـ FP4 RL post-training، وتثبت Rollout-ResQ كآلية فعّالة في الربط بين تفاعلات RL والدقة المفقودة، مما يجعل الطريق نحو تحسين الدقة أكثر وضوحًا وقابلية للتحقيق. هل تتطلعون إلى المزيد من التطورات في مجال الذكاء الاصطناعي؟ شاركونا في التعليقات!