في عالم البرمجيات والخوارزميات، تظل القابلية للاستخدام والتحديات المعقدة في حل مسائل البرمجة الخطية المتكاملة (MILP) موضوعاً حيوياً. إن القدرة على توليد مسائل صعبة حقاً من شأنها أن تسهم في تحسين أداء خوارزميات التعلم الذاتي وتقديم معايير جديدة لاختبار الحلول. ولكن كيف يمكن لنماذج اللغة الكبيرة (LLMs) قياس هذه الصعوبة بشكل فعّال؟

اعتمد الباحثون في هذا المجال على فكرة جديدة تتمثل في تصميم طريقة استباقية تجمع بين نموذج لغة كبير (مثل Gemma-4-12B وأيضاً Qwen3.5-4B) وحلّال خوارزمي، حيث يتنافس النموذجان بشكل متكرر لإنتاج مسائل أكثر تعقيداً. هذه العملية تتيح لمعدل النجاح أن يتطور بشكل متزايد بدون الحاجة إلى نماذج أولية.

لقد تم تطوير تقنيات جديدة مثل GRPO وتخصيص الحجم لنماذج مثل OptiScribe-12B وOptiScribe-4B. هذه النماذج ليست فعالة فقط في قياس الصعوبة، بل قادرة أيضاً على تحسين معدل القابلية للحل على الكثير من القضايا. على سبيل المثال، استطاع OptiScribe-12B رفع عدد العقد البحثية في حل مسائل الموقع المحدود إلى 5 مرات مقارنة بالنموذج الأساسي.

كما تميزت هذه النماذج بتجاوزها لمعايير الأداء العامة، مما يدل على إمكانية تحسين مكافآت خاصة بالتحسينات عبر استخدام هذه التقنيات.

تُظهر التجارب أن استخدام مكافآت مخصصة لقياس الصعوبة يعتبر خطوة هامة في تطوير نماذج اللغة الكبيرة. من المتوقع أن تُنشر الأكواد والنماذج بعد قبول هذه الدراسة، مما سيتيح فرصة استثنائية للبحث والتطوير في هذا المجال.