مع تزايد تعقيد المهام التي تنفذها نماذج اللغة الكبيرة (LLMs)، تزداد الحاجة إلى أساليب فعالة للتحقق من جودة النتائج المستخلصة منها. هنا يأتي دور VeriHarness، المنهجية المبتكرة التي ندرسها، والتي تهدف إلى تعزيز قدرة التحقق باستخدام نموذج أساسي ثابت وبدون الحاجة لمرجعيات أو معايير تقييم أثناء اختبار الأداء.

يتطلب التحقق الفعال في مثل هذه السيناريوهات آلية موثوقة لتحديد أي الادعاءات يمكن الوثوق بها. وقد أظهرت الدراسات أن الخلاف المتكرر بين النتائج يمكن أن يكشف عن بدائل صحيحة، بينما قد تؤدي الإجماع إلى إخفاء الأخطاء. لذلك، تم تطوير VeriHarness لتحويل نموذج اللغة الأساسي إلى مُحقق ذاتي، عبر تزويده بمساحة عمل وأدوات توثيق ومهارات تحقق قابلة لإعادة الاستخدام.

تشتمل هذه المنهجية على حل لمشكلة الخلاف يقوم بفحص الادعاءات المتنافسة مع الأدلة البيئية، بينما يتحدى مُحَرِك الإجماع الادعاءات المشتركة ويبحث عن الشروط الغائبة. تعزز النتائج التي يتم الحصول عليها من هذه العملية الانتقاء والمراجعة النهائية للمخرجات.

اختبرت VeriHarness عبر خمسة معايير عمل طويلة الأمد ونموذجين متقدمين، حيث حققت أعلى درجات اختيار من بين القواعد المعتمدة على التجربة. كما أثبتت الأدلة الداعمة للمراجعة تحسين الأداء، مع تحقيق مكاسب بارزة تتجاوز 6 نقاط مقارنة بالنتائج السابقة مع نماذج مثل Gemini 3.5 Flash وClaude Opus 4.8.

تُظهر هذه النتائج أن مهارات التحقق يمكن أن تتطور من خلال التغذية الراجعة عن الفشل، مما يجعل VeriHarness منهجًا حديثًا ومن الضروري لتحسين إجراءات التحقق الذاتي في المهام الطويلة الأمد. للمساهمة في الأبحاث المستقبلية في هذا المجال، تم إتاحة قاعدة بيانات كاملة تحتوي على حوالي 26,000 استجابة استعداد تم إنتاجها بتكلفة تتجاوز 100,000 دولار، مما يفتح أفقًا جديدًا للتعبير عن قدرات النماذج ومتانتها في التحقق من النتائج.