في عالم الذكاء الاصطناعي المتطور، أصبحت الأنظمة الوكيلة تعتمد بشكل متزايد على أساليب التوجيه لاختيار النماذج الأنسب لأداء المهام. ومع ذلك، غالبًا ما يتم تقييم الروترات المفتوحة المصدر باستخدام مهام مختلفة وبرك candidate متنوعة، مما يصعب من مقارنة أدائها بشكل مباشر.

في دراسة جديدة منشورة على منصات arXiv، تم تقديم بروتوكول قياس موحد وتقييم هجيني لأربعة تطبيقات روتر عبر مجموعة من المعايير مثل RouterBench وBFCL v4 وtau2-bench وWebArena. تمت دراسة 290 مهمة مُجمدة مقارنة بمصفوفة مغلقة تحتوي على 2610 نتيجة محتملة.

أظهرت الدراسة أن ثلاثة من الروترات تُصدر تصنيفات ثابتة أو شبه ثابتة، بينما أظهر روتر vLLM Semantic تباينًا ملحوظًا بناءً على محتوى التحدي، ومع ذلك لم يحقق أعلى معدل نجاح ضمن المعايير الأربعة المُختبرة.

من الجدير بالذكر أن روتر Always-Mid أثبت تطابقًا تامًا مع Aurelio في ثلاثة من المعايير، بينما تراوحت الاختلافات في المعيار الرابع بنسبة 0.003 فقط. بينما لم تبرز اختبارات التفوق على مستوى المهام أي ميزات خاصة لأداء النموذج عند إجراء مقارنة مع تخصيص غير مباشر لمحتوى التحدي.

تفيد النتائج بأن المكاسب المرصودة تحت هذه الظروف تتابع توزيع الطبقات المختارة بشكل أوثق من استهداف المهام المحدد. بناءً على ذلك، تعتبر القواعد الثابتة والتوزيعات المختارة للطبقات ضرورية كضوابط في تقييم الروترات؛ وهذه النتائج محصورة على هذه التكوينات ومعايير الاختبار المجمدة.