في عالم البحث العلمي، تتطلب بناء المعايير العلمية جهوداً ضخمة من قبل الخبراء في المجال، حيث يتم كتابة المهام ومراجعة أعمال بعضهم البعض، أو تعديل المواد الموجودة من كتب الدراسة والأبحاث المنشورة. ورغم أن هذه الطرق قد تثمر تقييمات فعالة، إلا أنها تستنزف الكثير من الوقت والجهد. هنا يأتي دور النماذج اللغوية (Language Models) لتسريع العملية عبر اقتراح مرشحات سريعة.

لكن التحدي الذي يبقى هو كيفية قبول هذه الاقتراحات. نركز على الأسئلة العلمية التي تتطلب إجابات قائمة على عمليات حسابية باستخدام برمجيات متخصصة، وليس فقط التفكير الذاتي. إذا فشل النص البرمجي في توفير الجواب الصحيح أو أعطى نتيجة مختلفة، فإن الاقتراح يُعتبر غير صالح. وعليه، تم تقديم ToolGate كحل فعال، والذي يعامل كل عنصر تم إنتاجه كاقتراح ويحتفظ به فقط في حال اجتاز ثلاثة مراحل تحكم.

الأولى، يجب على النص البرمجي القابل للتنفيذ أن يعيد إنتاج الإجابة المقترحة عند تشغيله باستخدام البرمجيات العلمية. الثانية، يتم استبعاد المرشحات التي يمكن للنماذج حلها بسهولة دون الحاجة للأدوات المتخصصة. أما المرحلة الثالثة، فيجب على وكيل يستخدم تلك الأدوات أن ينجز الحل لكل اقتراح يتجاوز المرحلتين السابقتين ضمن حدود زمنية محددة.

خلال تطبيق ToolGate باستخدام FEniCSx، تم إجراء 500 محاولة إنتاجية، وتم الاحتفاظ بـ478 مرشحاً قابلاً. أما عند التصفية النهائية، تم استبعاد 222 من ذلك المجموعة، واستُبعد 121 آخرين بإجراء مكالمات مباشرة إلى واجهة برمجة التطبيقات GPT-5.5. من الـ135 المتبقية، تمكن وكيل GPT-5.5 Codex CLI بالوصول إلى FEniCSx من حل 130 منها، مما أسفر في النهاية عن 128 بروتوكولاً فريداً.

ToolGate يتيح تحويل عملية التحقق المتكررة وفحص الصعوبة إلى عملية قابلة للتدقيق، بينما تُركت تصميم المجالات والمراجعة النهائية للخبراء. هل تتوقعون أن تُحدث هذه الأداة تأثيراً عميقاً في الطريقة التي نبني بها المعايير العلمية؟ شاركونا آرائكم في التعليقات!