في عالم نماذج اللغة الكبيرة (LLMs)، يعد استخدام الأدوات جزءًا أساسيًا من تعزيز قدراتها. ومع ذلك، تم إغفال جانب حيوي وهو أهمية ملء المعلمات بشكل صحيح لاستدعاءات الأدوات. في الوقت الذي كان التركيز فيه غالبًا على اختيار الأداة الصحيحة وتنظيم ترتيب الاستدعاءات، فإن الأقل حاجة للاهتمام هو الدقة في إدخال المعلمات.

تشير الدراسات إلى أن العديد من النماذج الرائدة، حتى في بيئات مثل الشبكات السحابية، تكمل أقل من نصف الاستدعاءات بشكل صحيح. لكنَّ التحليلات الأخيرة تكشف عن معلومات غنية تحتويها الحالات الخفية للنموذج، مما يتيح تصحيح المدخلات. برزت هنا فكرة جديدة: باستخدام "البروبس" (probes) كأداة إرشادية، حيث يمكن تحديد ما إذا كانت القيمة المدخلة صحيحة أم لا.

قدمت الدراسة نهجًا موحدًا يعتمد على إطار عمل دقيق يتضمن طريقتين مكمّلتين: "التدريب المعزز عبر البروبس" (PBT) الذي يستخدم البروبس لتصفية الاستدعاءات المولدة ذاتيًا، و"إعادة التصنيف الموجه بالبروبس" (PGR) لاختيار المرشحين الأفضل أثناء عملية الاستدلال. لدعم التقييم المنهجي، تم إطلاق "بارام بانش" (ParamBench)، وهو معيار مبني على واجهات برمجة التطبيقات الحقيقية من الشبكات السحابية ويصنف الحالات إلى خمس مستويات من الصعوبة.

أظهرت التجارب المكثفة على خمسة نماذج مفتوحة أن الطريقة الجديدة تؤدي إلى تحسين كبير في إنتاج المعلمات، حيث ارتفعت نسبة النجاح من 19.7% إلى 59.6%. هذا التحسين ليس مجرد إنجاز؛ بل يمثل قفزة نوعية في كيفية استغلال نماذج اللغة الكبيرة لأدواتها وزيادة كفاءتها بشكل مضاعف.