في عصر الذكاء الاصطناعي، أصبح تصميم أنظمة الخدمة أمراً معقداً يتطلب اتخاذ خيارات دقيقة بين بدائل متعددة، مثل اختيار أفضل نوع من روبوتات المحادثة (chatbots) أو السياسات المثلى لتوجيه الطلبات أو إجراءات ضبط الجودة الأكثر فعالية. يعتمد الكثير من هذه الأنظمة على أدلة جودة الأداء المستندة إلى النصوص، مثل محاضر دعم العملاء وتقارير الشكاوى، بدلاً من القياسات الكمية التقليدية.
تُظهر نماذج اللغة الكبيرة (Large Language Models) قدرة فائقة على قراءة هذه الأدلة النصية وإنتاج درجات جودة موحدة، لكن هذه الأحكام الآلية ربما تعاني من تحيزات منهجية تختلف من خيار لآخر. وعلى الرغم من أن مراجعة الخبراء الأفراد دقيقة، إلا أن كلفتها مرتفعة.
تتناول هذه الدراسة كيفية تحديد أفضل تكوين للخدمات بثقة عالية مع تقليل عمليات التدقيق البشري المكلفة، بفضل الجمع بين التقييمات الآلية الرخيصة ولكن المتحيزة. نرسم هذا كمشكلة قرار متسلسلة حيث يتم رصد درجة ثابتة غير موضوعية لكل تقييم، ويمكن الحصول على نتيجة موثوقة اختيارياً بتكلفة إضافية.
نثبت أن اختيار النموذج بناءً على تقييمات LLM فقط يفشل في ظل التحيزات المتصلة بالبدائل، وأن المقيمات الانتقائية الساذجة قد تحتوي على تحيزات. لذلك، طورنا مقدرًا يجمع بين درجات التقييم غير الموضوعية وقياسات الوزن العكسي لنسب النتائج لتكوين تسلسل زمني ثقة صالحة في أي وقت.
خوارزمية PP-LUCB لدينا تقرر بشكل مشترك أي البدائل يجب تقييمها وما إذا كان ينبغي طلب عمليات تدقيق بشرية، مع التركيز على المراجعات حيث يكون حكم LLM أقل موثوقية. أثبتنا صحة هذه الخوارزمية وأسسنا حدود تكلفة معتمدة على الحالات تُظهر كفاءة قريبة من المثالية.
في تجربة تصنيف تذاكر دعم العملاء، نجحت خوارزمية PP-LUCB في تحديد أفضل نموذج في 40 من 40 تجربة، مع تحقيق تقليل في تكلفة التدقيق بنسبة 90%. هذه النتائج تشير إلى تغيير كبير محتمل في كيفية تصميم وتحسين أنظمة الخدمة.
تحقيق الكمال في أنظمة الخدمة: كيف تُعيد نماذج اللغة الكبيرة تصميم التجارب من خلال التحليل النصي
تقدم هذه الدراسة حلاً فعالاً لتصميم أنظمة الخدمة باستخدام نماذج اللغة الكبيرة (LLMs) لتحسين اتخاد القرارات رغم التحيزات. بفضل خوارزمية PP-LUCB، يمكن تقليل تكاليف التدقيق البشري مع الحفاظ على فعالية عالية في التصنيف.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
