مع تزايد الطلب على خدمات الاستدلال من نماذج اللغات الضخمة (Large Language Models)، أصبح من الضروري على موفري النماذج اتخاذ قرارات فعالة فيما يتعلق بالطلبات التي ينبغي تلبيتها أولاً، خاصة عندما يتجاوز الطلب قدرة الحوسبة المتاحة. وكما هو معروف، تختلف تفضيلات المستخدمين فيما يتعلق بالفترة الزمنية التي يمكنهم الانتظار فيها للحصول على خدمة API للذكاء الاصطناعي.

لحل هذه التحديات، تم تصميم مزادات الاستدلال، مما يوفر للمستخدمين الفرصة لتقديم عطاءات للحصول على خدمة أسرع، بدلاً من الاعتماد على هيكليات تسعير ثابتة وضعت قدراً كبيراً من الطلب في مستويات خدمة مقيدة. يساعد هذا النموذج الاقتصادي في تخصيص الأولوية بطريقة فعالة، دون المساس بسرعة الاستجابة.

تستند الأنظمة المطورة على خوارزميات سريعة تعمل على تحديد الأسعار التي تعزز من تقديم عطاءات صادقة، وهو ما يزيد من الشفافية والكفاءة في تقديم الخدمة. بالإضافة إلى ذلك، تم تصميم وكيل مزايدة تلقائي يمكن المستخدمين من تحديد ميزانية استدلال، حيث يقوم الوكيل بضبط العطاءات تلقائيًا مع مرور الوقت لتعظيم فائدة المستخدم ضمن قيود الميزانية.

أثبتت التجارب الفعلية فاعلية هذا النظام الجديد، حيث زادت من رفاهية النظام مع الحفاظ على مزايا استخدام التخزين المؤقت وسرعة الاستجابة المترتبة على إطار عمل تقديم الاستدلال SGLang، الذي يعد من أحدث الحلول في هذا المجال.