في إطار تسارع الابتكارات في مجال الذكاء الاصطناعي، أكدت الأبحاث على أهمية الأداء الفعال والدقيق لخوادم نماذج اللغات الضخمة (Large Language Models) المصممة لخدمة عدة مستأجرين. ومع ارتفاع كفاءة استخدام وحدات معالجة الرسوميات (GPU)، فإن ظهور نماذج مثل LLMVisor يمنح المطورين أدوات جديدة لتحسين الأداء.

LLMVisor هو نموذج مبتكر يحدد وقت التأخير بشكل فعال خلال التنفيذ، مما يمكّن من تحسين توزيع الموارد بين المستخدمين المختلفين. يعتمد النموذج على توجيه السقف (roofline) لرصد التأخيرات المتعلقة بالذاكرة والحساب، ويستخدم نموذجاً خطياً قصيرًا لتحليل الخصائص المتعلقة بحركة الإدخال والإخراج الخاصة بالذاكرة وعمليات الحساب (FLOPs).

تم تقييم LLMVisor باستخدام نماذج Llama 3.1-8B وQwen 2.5-14B/32B على وحدات معالجة الرسوميات A100/H100 تحت ظروف مختلطة من التوازي ونماذج الأحمال. وأظهرت النتائج تميز LLMVisor حيث حقق تقريبًا دقة R-squared مثالية، مما أدى إلى تقليل الخطأ النسبي بشكل ملحوظ وخاصةً في عمليات التمهيد والفك، على الرغم من تباين حجم الدُفعات واختلاف تسلسل البيانات.

بهذه الطريقة، يوفر LLMVisor حلاً فعالاً يساهم في تعزيز الكفاءة والشفافية في استخدام نماذج اللغات الضخمة المتعددة المستأجرين، مما يجعله أداة ضرورية لمطوري الذكاء الاصطناعي في المستقبل.