مع تقدم الذكاء الاصطناعي، أصبحت أدوات النماذج اللغوية الكبيرة (LLMs) تحظى بشعبية متزايدة، خصوصًا عندما يتعلق الأمر بحل المشكلات الرياضية. في هذا الإطار، يستعرض بحث حديث تقنيات جديدة لاستدعاء أدوات رمزية، مستخدمًا طريقة تحليل خاصة تُعرف بتفكيك المجموعات الموزونة للحد من تباينات المعادلات. تقدم هذه الطريقة مسارًا يمكن التحقق منه بشكل قاطع لضمان صحة العلاقات الرياضية.

يجري هذا البحث بشكل رئيسي على أساس تفكيك مجموعات (SOS) وهو أسلوب يمكن أن يُستخدم لإثبات عدم سلبية المعادلات متعددة الحدود. إذ يُعد العثور على تفكيك فعّال بمثابة تحدٍّ، نظرًا لوجود تجمعات غير فريدة تتطلب تنسيق العديد من التحولات الرمزية. في هذا السياق، تم تطوير وكيل يجمع بين تدريب المهام الجبرية، والأدوات الرمزية، والتحسين المعتمد على التحقق.

في البحث، لم يقتصر الأمر فقط على تدريب وكيل على مجموعة من المهام، بل تم إنشاء 1.35 مليون مثال صناعي يدعم مسارات متعددة تعزز الأداء. ركزت العملية التدريبية على تعزيز التعلم تحت الإشراف (SFT) لتوجيه المشكلات الجبرية وتصورات رمزية محاكاة، بالإضافة إلى استخدام تحسين سياسة المجموعة النسبية (GRPO) مع جوائز رمزية خاصة بالمهام.

تشير نتائج البحث إلى أن النظام الذي يستخدم SFT+GRPO+الأدوات هو الأقوى بين أربع تكوينات تم تقييمها، حيث حقق نموذج التحقق من مدى النجاح 78.96% في مجموعة المجموعات الموزونة، مقارنة بـ 44.73% للنموذج الأساسي. كما حقق النظام دقة إجمالية وصلت إلى 91.75% عبر تسع مهام متعددة الحدود.

توضح هذه التجربة كيف يمكن تركيب تدريب مهارات خاصة بالمجال، مع أدوات قابلة للتنفيذ، وما يُعرف بتغذية راجعة من المدققين. من المحتمل أن تُفيد هذه النتائج في تصميم وكلاء استدعاء الأدوات في مجالات أخرى تتطلب مخرجات قابلة للتحقق.