مع الارتفاع المتزايد في استخدام نماذج اللغات الضخمة (Large Language Models)، أصبح دور مقدمي الخدمات الخارجية الذين يقومون بنشر النماذج ذات الوزن المفتوح جزءًا أساسيًا من النظام البيئي للتكنولوجيا. لذا، فإن تدقيق جودة واجهات برمجة التطبيقات (APIs) الخاصة بهم أصبح تحديًا مفتوحًا.

تقوم فكرة Ventor-QTest على صياغة نموذج التحقق من هذه الواجهات كعملية عشوائية، حيث تم تقديم طريقة تدقيق مختلطة تعتمد على نموذج أسود لا تتطلب أي معلومات احتمالية من واجهة البرمجة المستهدفة. تتضمن هذه الطريقة مكونًا لإرسال طلبات متعددة، حيث يتم إرسال كل سياق مقيد ثابت إلى الهدف عدة مرات، واستعادة توزيع الناتج الفئوي من العدادات النصية، وإبلاغ عن فقدان متوسط الدقة (Average Fidelity Loss - AFL) كإحصائية تصحيحية ذات تحيز صفري.

بالإضافة إلى ذلك، يتم استخدام مكون تسلسلي طويل لإقرار فقدان الدقة القصوى (Extreme Fidelity Loss - EFL) عبر طرف علي عشوائي مرجعي. أظهرت النتائج عبر ثلاثة شروط لرصد الحسابات التي تعتمد على اللاحقين أن AFL يتناسب بشكل كبير مع مقارنات KL. كما كشفت التحليلات أن تباين EFL مرتبط بشكل ملحوظ مع انخفاض معدل النجاح في مهام Benchmark مع زيادة تعرض المهمة.

هذه النتيجة تشير إلى أن طول المهام يمكن أن يؤثر على الدقة بشكل حاد، مما يدفعنا لدعوة تقديم كلي لكل من AFL وEFL عند تدقيق المهام الطويلة. لا تفوت الفرصة لاكتشاف الأداة المفتوحة المصدر المتاحة على GitHub من Tencent، والتي تستهدف تعزيز دقة آليات تقييم النماذج المستقبلية.