في عالم الذكاء الاصطناعي، يُعتبر الذكاء الاصطناعي التوليدي من أبرز المجالات وأكثرها تطوراً. ومع تزايد الاعتماد على نماذج اللغات الضخمة (Large Language Models)، أصبح من الضروري أحد التحديات الكبيرة هو الفجوة الهيكلية بين توليد البيانات الاحتمالية ومتطلبات المخططات الحاسوبية الثابتة. تقدم مجموعة من الباحثين إطار عمل جديد يسمى RL-Struct، والذي يعتمد على تقنية بسيطة ولكن فعالة في التعلم المعزز.
يستخدم RL-Struct تقنية تحسين السياسات المنظمة بواسطة التدرج (Gradient Regularized Policy Optimization - GRPO) مع دالة مكافأة هرمية، مما يوفر توافقًا أفضل بين نماذج اللغات الضخمة والقيود الهيكلية المطلوبة. بينما تخلص هذا الإطار من الشبكة النقدية (critic network)، فقد أدى ذلك إلى تقليل ذروة استهلاك الذاكرة العشوائية VRAM بنسبة 38% مقارنة بأساليب مثل PPO.
فاجأ الإطار الجديد المجتمع الأكاديمي حين حقق 89.7% من الدقة الهيكلية و92.1% من صلاحية النتائج في المهام المعقدة المرتبطة بالبيانات الهيكلية مثل JSON. بالإضافة إلى ذلك، تم الإبلاغ عن وجود منهج طارئ، حيث يركز النموذج على النحو قبل الدلالات.
الإطار RL-Struct متاح للجمهور على منصة Hugging Face، مما يتيح للباحثين والمطورين إمكانية الوصول إلى أدوات تحقق نتائج متقدمة في معالجة البيانات الهيكلية. سيحدث هذا الإطار تحولاً ملحوظًا في كيفية اعتماد الذكاء الاصطناعي على بعض الأنماط الثابتة للبيانات، مما يمهد الطريق لمزيد من الابتكار والإبداع في هذا المجال المثير.
الذكاء الاصطناعي يحقق قفزة نوعية: RL-Struct إطار تعلم معزز لضمان إخراج هيكلي موثوق!
تم تقديم RL-Struct كإطار تعلم معزز خفيف الوزن لتحسين دقة التخريج الهيكلي في نماذج اللغات الضخمة. يؤكد البحث تفوق هذا الإطار الجديد على الأنظمة السابقة، مما يعزز كفاءة سير العمل الأوتوماتيكي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
