تُعتبر مهمة الاستنتاج اللغوي (Natural Language Inference - NLI) واحدة من المهام الأساسية في فهم اللغة الطبيعية، حيث تُستخدم في تطبيقات حيوية مثل التحقق من الحقائق والإجابة على الأسئلة واسترجاع المعلومات. ورغم أهميتها البالغة، تعتمد معظم أنظمة NLI الحالية على التعلم الخاضع للإشراف مع مجموعات بيانات غالبًا ما تحتوي على أخطاء وتحاملات في التوضيح، مما يحد من قدرتها على التعميم والتطبيق في العالم الحقيقي.
في ورقتنا، نقدم نهجًا جديدًا يعتمد على التعلم المعزز باستخدام طريقة تحسين السياسة النسبية الجماعية (Group Relative Policy Optimization - GRPO) لتعليم سلسلة من الأفكار (Chain-of-Thought - CoT) في الاستنتاج اللغوي. تُلغي هذه الطريقة الحاجة إلى الاعتماد على تفسيرات موضوعة من قِبل البشر، مما يتيح لنا التدريب على مجموعات بيانات صعبة مثل ANLI.
قمنا بضبط نماذج لغوية بحجم 7B و14B و32B باستخدام تقنيات فعالة من حيث المعلمات مثل LoRA وQLoRA، حيث أظهرت تلك النماذج أداءً قويًا عبر معايير NLI القياسية والتنافسية. وعند الوصول إلى حجم 32B، تُظهر النماذج التي تم تدريبها باستخدام GRPO قدرة أفضل على التعميم مقارنةً بالأساليب الخاضعة للإشراف التقليدية في مجموعات البيانات التنافسية.
وبفضل تقنيات تقليل حجم الذاكرة مثل AWQ، يتناسب النموذج بحجم 32B ضمن 22 جيجابايت من ذاكرة CUDA، مما يوفر إطارًا عمليًا قابلًا للتوسع لبناء أنظمة NLI قوية دون التفريط في جودة الاستنتاج. تعد هذه البحوث خطوة مهمة نحو تحسين تطبيقات فهم اللغة الطبيعية وسرعة استجابتها في ظل التحديات الحديثة والموقف المنافس.
ثورة جديدة في فهم اللغة: تقييم مقاييس قابلية التوسع ونموذج GRPO في الاستنتاج اللغوي
تستخدم أنظمة الاستنتاج اللغوي تقنيات التعلم المعزز لتحسين دقتها ومرونتها. ونموذج GRPO يُظهر أداءً متفوقًا من خلال تحسين قابلية التعميم في بيئات صعبة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
