في عالم الذكاء الاصطناعي المتطور، أصبحت الأنظمة الوكيلة تعتمد بشكل متزايد على أساليب التوجيه لاختيار النماذج الأنسب لأداء المهام. ومع ذلك، غالبًا ما يتم تقييم الروترات المفتوحة المصدر باستخدام مهام مختلفة وبرك candidate متنوعة، مما يصعب من مقارنة أدائها بشكل مباشر.
في دراسة جديدة منشورة على منصات arXiv، تم تقديم بروتوكول قياس موحد وتقييم هجيني لأربعة تطبيقات روتر عبر مجموعة من المعايير مثل RouterBench وBFCL v4 وtau2-bench وWebArena. تمت دراسة 290 مهمة مُجمدة مقارنة بمصفوفة مغلقة تحتوي على 2610 نتيجة محتملة.
أظهرت الدراسة أن ثلاثة من الروترات تُصدر تصنيفات ثابتة أو شبه ثابتة، بينما أظهر روتر vLLM Semantic تباينًا ملحوظًا بناءً على محتوى التحدي، ومع ذلك لم يحقق أعلى معدل نجاح ضمن المعايير الأربعة المُختبرة.
من الجدير بالذكر أن روتر Always-Mid أثبت تطابقًا تامًا مع Aurelio في ثلاثة من المعايير، بينما تراوحت الاختلافات في المعيار الرابع بنسبة 0.003 فقط. بينما لم تبرز اختبارات التفوق على مستوى المهام أي ميزات خاصة لأداء النموذج عند إجراء مقارنة مع تخصيص غير مباشر لمحتوى التحدي.
تفيد النتائج بأن المكاسب المرصودة تحت هذه الظروف تتابع توزيع الطبقات المختارة بشكل أوثق من استهداف المهام المحدد. بناءً على ذلك، تعتبر القواعد الثابتة والتوزيعات المختارة للطبقات ضرورية كضوابط في تقييم الروترات؛ وهذه النتائج محصورة على هذه التكوينات ومعايير الاختبار المجمدة.
ابتكار جديد في تقنيات التوجيه: تقييم هجيني لروترات مفتوحة المصدر برباعية المعايير
يكشف بحث جديد عن تقييم مشترك لأساليب توجيه نماذج الذكاء الاصطناعي، حيث تم اختبار أربعة روترات مفتوحة المصدر عبر معايير متعددة. النتائج تشير لأهمية توزيع الطبقات المحددة في تقييم الأداء.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
