تتزايد أهمية وكلاء الذكاء الاصطناعي في مجالات البحث والتطوير، ومع ذلك، كانت المعايير السابقة تقيمهم على مدى قدرتهم على تنفيذ إجراءات محددة أو في فضاءات عمل محدودة. ومع أن المهام المفتوحة قد تبدو غير محددة، إلا أنها غالباً ما يمكن حلّها من خلال استرجاع وصفة معروفة وضبط عدد قليل من المعلمات، مما يجعل من الصعب التأكد مما إذا كانت النتائج القوية تعكس تحسينًا حقيقيًا أو حلولًا محفوظة.
في هذا السياق، تم تقديم معيار إنفراس بنش (InferenceBench)، حيث يُطلب من الوكلاء نشر خادم استنتاج متوافق مع OpenAI وتحسين سرعة استنتاج نموذج اللغة الكبير (LLM). يتم تزويد كل وكيل بنموذج LLM مستهدف، ووحدة معالجة رسومات من نوع H100، وسيناريو تحسين، وميزانية زمنية تبلغ ساعتين.
تتضمن سيناريوهات التحسين الثلاثة عزل اختناقات مختلفة في الاستنتاج (زمن التأخير في التحميل، وزمن التأخير في التشفير، ونسبة الطلبات المتزامنة)، فيما يتوازن السيناريو الرابع بين الثلاثة جميعًا في آن واحد. من خلال 15 تكوينًا متقدماً للوكلاء، أظهر الوكلاء تحسنًا ملحوظًا مقارنةً بقاعدة PyTorch البسيطة (حتى 8.08 مرات)، وغالباً ما تتطابق نتائجهم أو تتجاوز المحركات الخدمية بالإعدادات الافتراضية (4.05 مرات لنموذج vLLM).
ومع ذلك، تظل النتائج دون مستوى بحث بسيط عن معلمات تحت نفس الميزانية الزمنية (حتى 11.53 مرة). تشير التحليلات النوعية لمسارات الوكلاء إلى أنه رغم طرحهم للعديد من تقنيات التحسين الملائمة، فإنهم غالبًا ما يتجهون نحو إطار استنتاج واحد. حيث يقومون باختبار عدد قليل من التكوينات المميزة ويقضون الميزانية المتبقية في إعادة القياس، وإصلاح، أو تحسين المعلمات بدلًا من استكشاف استراتيجيات مختلفة تمامًا.
بشكل عام، يُظهر معيار إنفراس بنش قدرة الوكلاء على العمل في بيئة هندسية مفتوحة للذكاء الاصطناعي، حيث تؤدي الحلول المحفوظة إلى تحسينات محدودة. فما رأيكم في هذا التطور الذي يجعل الذكاء الاصطناعي يقترب من مستويات الإبداع البشري؟ شاركونا آراءكم في التعليقات!
إنفراس بنش: معيار جديد لتحسين استنتاجات نماذج اللغات الضخمة بواسطة وكلاء الذكاء الاصطناعي!
يقدم معيار إنفراس بنش (InferenceBench) طريقة مبتكرة لتقييم أداء وكلاء الذكاء الاصطناعي في تحسين استنتاجات نماذج اللغات الضخمة. بدلاً من الاعتماد على حلول محفوظة، يشجع هذا المعيار الوكلاء على استكشاف استراتيجيات متنوعة لتحسين سرعة الاستنتاج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
