في عصر الذكاء الاصطناعي، أصبح تصميم أنظمة الخدمة أمراً معقداً يتطلب اتخاذ خيارات دقيقة بين بدائل متعددة، مثل اختيار أفضل نوع من روبوتات المحادثة (chatbots) أو السياسات المثلى لتوجيه الطلبات أو إجراءات ضبط الجودة الأكثر فعالية. يعتمد الكثير من هذه الأنظمة على أدلة جودة الأداء المستندة إلى النصوص، مثل محاضر دعم العملاء وتقارير الشكاوى، بدلاً من القياسات الكمية التقليدية.

تُظهر نماذج اللغة الكبيرة (Large Language Models) قدرة فائقة على قراءة هذه الأدلة النصية وإنتاج درجات جودة موحدة، لكن هذه الأحكام الآلية ربما تعاني من تحيزات منهجية تختلف من خيار لآخر. وعلى الرغم من أن مراجعة الخبراء الأفراد دقيقة، إلا أن كلفتها مرتفعة.

تتناول هذه الدراسة كيفية تحديد أفضل تكوين للخدمات بثقة عالية مع تقليل عمليات التدقيق البشري المكلفة، بفضل الجمع بين التقييمات الآلية الرخيصة ولكن المتحيزة. نرسم هذا كمشكلة قرار متسلسلة حيث يتم رصد درجة ثابتة غير موضوعية لكل تقييم، ويمكن الحصول على نتيجة موثوقة اختيارياً بتكلفة إضافية.

نثبت أن اختيار النموذج بناءً على تقييمات LLM فقط يفشل في ظل التحيزات المتصلة بالبدائل، وأن المقيمات الانتقائية الساذجة قد تحتوي على تحيزات. لذلك، طورنا مقدرًا يجمع بين درجات التقييم غير الموضوعية وقياسات الوزن العكسي لنسب النتائج لتكوين تسلسل زمني ثقة صالحة في أي وقت.

خوارزمية PP-LUCB لدينا تقرر بشكل مشترك أي البدائل يجب تقييمها وما إذا كان ينبغي طلب عمليات تدقيق بشرية، مع التركيز على المراجعات حيث يكون حكم LLM أقل موثوقية. أثبتنا صحة هذه الخوارزمية وأسسنا حدود تكلفة معتمدة على الحالات تُظهر كفاءة قريبة من المثالية.

في تجربة تصنيف تذاكر دعم العملاء، نجحت خوارزمية PP-LUCB في تحديد أفضل نموذج في 40 من 40 تجربة، مع تحقيق تقليل في تكلفة التدقيق بنسبة 90%. هذه النتائج تشير إلى تغيير كبير محتمل في كيفية تصميم وتحسين أنظمة الخدمة.