تعتبر نماذج اللغات الضخمة (Large Language Models - LLMs) من العناصر الأساسية المستخدمة في تقديم الخدمات الذكية على الإنترنت. لكن، يتطلب استخدامها عبر منصات الحوسبة المختلفة توازناً دقيقاً بين عوامل الجودة والسرعة واستخدام الطاقة. في دراسة حديثة، تم إجراء بحث شامل حول أداء نماذج LLM المتواجدة على عتاد الحوسبة المتناهي، بما في ذلك جهاز NVIDIA Jetson AGX Orin وخادم قريب مجهز بوحدات معالجة مركزية ووحدات معالجة رسومية.

ولتحقيق نتائج هذه الدراسة، تم تقييم مجموعة متنوعة من نماذج LLM المفتوحة والشروط المرتبطة بها باستخدام حمل عمل ثابت يتمثل في أسئلة وأجوبة، كما تم مقارنتها مع النموذج المعروف GPT-4o المستخدم في السحابة، من حيث الدقة وسرعة الاستجابة.

أظهرت النتائج أن التنفيذ على الخادم المجهز بوحدات معالجة رسومية (GPU) يوفر أقل زمن استجابة من ناحية المعالجة، بينما أظهر جهاز Jetson Orin مستويات طاقة أقل مما يتماشى مع قدراته المحدودة. كذلك، فإن التنفيذ الذي يعتمد على وحدات المعالجة المركزية (CPU) يأتي بشكل دائم في مرتبة أقل من حيث سرعة الاستجابة والطاقة المستخدمة.

علاوة على ذلك، تم إثبات أن عدد المعلمات وحجم ملفات الأوزان المحملة لا يمكن الاعتماد عليهما بشكل موثوق للتنبؤ بالدقة أو السرعة بشكل دقيق. باستخدام تحليل الحدود الباريتية (Pareto-frontier)، تم استكشاف كيف يمكن أن تؤثر قرارات النشر على جودة الخدمة المقدمة، مما يبرز أن الاعتماد فقط على مقاييس الأداء الفنية يمكن أن يؤدي إلى اتخاذ قرارات غير مثالية، خصوصاً فيما يتعلق بالخدمات التفاعلية الحساسة للوقت.

ما رأيكم في أهمية هذا البحث لتحسين خدمات الذكاء الاصطناعي؟ شاركونا في التعليقات.