في الآونة الأخيرة، أظهرت النماذج اللغوية الصغيرة (Small Language Models) جاذبية كبيرة من حيث إمكانية نشرها محليًا، إلا أنها غالبًا ما تواجه تحديات ملحوظة عند التعامل مع مهام الحساب المعقدة. في دراسة حديثة، قام الباحثون بالتحقيق في إمكانية استخدام بيانات استدلالية مصنعة لتحسين أداء هذه النماذج تحت قيود الأجهزة الاستهلاكية.

بدأ الباحثون بمشروع GSM8K، حيث قاموا بتوليد مجموعة بيانات ضخمة تضم 21,250 مثالًا لمسائل رياضية مدرسية باستخدام نموذج GPT-5-mini. هذه البيانات تجمع بين مسارات الحلول بلغة طبيعية، وتعليمات خفيفة بأسلوب سقراطي، وتنوع هيكلي، وسياقات مشوشة غير ذات صلة. بدورها، تم تحسين نماذج Qwen3-0.6B و Qwen3-1.7B باستخدام تقنيات LoRA على أجهزة استهلاكية مثل Apple M4 التي تبلغ سعة الذاكرة العشوائية فيها 16 جيجابايت.

أظهرت النتائج تحسنًا ملحوظًا في دقة المطابقة الكاملة على مجموعة بيانات GSM8K، حيث ارتفعت من 36.5% إلى 49.1% بالنسبة لنموذج Qwen3-0.6B، ومن 53.5% إلى 66.5% بالنسبة لنموذج Qwen3-1.7B. وعلاوة على ذلك، كانت النتائج في اختباراته ذات الصلة قوية، حيث وصلت دقة الأداء إلى 98.9% على MultiArith و 73.0% على SVAMP، مقارنة بـ 54.4% و 45.3% للنموذج الأساسي.

تحليل البيانات نوعيًا يشير إلى أن النماذج المحسنة تنتج مسارات استدلال أقصر، وتقلل من الأخطاء في الحساب واستخدام المشتتات، وتستفيد بشكل أكثر اتساقًا من نماذج العينة الذاتية. لذلك، تعكس هذه النتائج أن تصميم بيانات الاستدلال المصنوعة بتكلفة منخفضة يمكن أن يعزز بشكل ملحوظ من تكيف النماذج اللغوية الصغيرة مع المهام الرياضية المعقدة. علاوة على ذلك، يمكن تفسير المكاسب التي تحققت على أنها دليل على فعالية البيانات الاستدلالية المصنوعة بدلاً من اختبار سببي لتوجيه سقراطي فقط.