في عالم الذكاء الاصطناعي (AI) الحديث، لا يكفي أن تمتلك نماذج لغوية ضخمة (Large Language Models) قادرة على معالجة البيانات، بل تحتاج أيضًا إلى كفاءة في استخدام واستخراج قدراتها على الأساليب والأجهزة المتنوعة. وهنا يأتي دور كينيلجنBench، الذي يمثل البداية لتطوير بنية معيارية موحدة تهدف إلى تقييم كُوَانِيل Triton التي يتم إنشاؤها بواسطة هذه النماذج.
يجمع كينيلجنBench بين مصادر متعددة وأجهزة متعددة لتوفير تقييم شامل لاستراتيجية تطوير الكود. يتضمن النظام الجديد تغطية واسعة لأكثر من 210 عوامل تشغيل من PyTorch ATen، بالإضافة إلى عوامل تشغيل متقدمة مثل vLLM وبعض الروتينات الخاصة من cuBLAS، مما يجعله معيارًا متميزًا جدًا في هذا المجال.
أجريت الاختبارات على ستة منصات للأجهزة، مع استهلاك يتجاوز 15 مليار توكن خلال التقييم. أظهرت العمليات التلقائية تحسناً في دقة النتائج، لكن لم يكن هناك طريقة واحدة تتفوق عبر المصادر والأجهزة. كان التحدي الأكبر في دقة الأداء هو من نصيب vLLM، في حين وضعت cuBLAS السقف الأعلى للأداء.
مع تلك التحسينات، وكما أظهرت النتائج، فإن التكاليف كانت مرتفعة: بلغ المتوسط 4.99 مليون توكن لكل عملية ناجحة، في حين ارتفعت تلك النسبة إلى 6.25 مليون للتقنيات المحسنة. تكشف هذه النتائج أيضًا عن أهمية مصدر العوامل التشغيلية، ونوع الجهاز، والبنية التحتية الذاتية كعوامل مستقلة في قدرة تطوير الكود، مما يدل على أن النجاح في بيئة معروفة لا يعني دائماً الجاهزية للتطبيق.
كينيلجنBench: ثورة في تقييم النماذج اللغوية الضخمة من خلال بنية معيارية موحدة
تم الكشف عن كينيلجنBench، أول بنية معيارية موحدة لتقييم كُوَانِيل Triton المُولَّدة بواسطة النماذج اللغوية الضخمة (LLMs). هذا الابتكار يعد خطوة كبيرة نحو تحسين أداء الأنظمة الذكية وتعزيز دقة الكود عبر منصات متعددة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
