تُعتبر نماذج اللغات الضخمة (LLMs) من أهم الابتكارات في مجال الذكاء الاصطناعي، حيث يتم دمجها في أنظمة البرمجيات وخدمات الذكاء الاصطناعي مما يجعل فعالية خدمتها من الأمور الحيوية في هندسة البرمجيات. تواجه جهود تقديم (Serving) هذه النماذج تحديات متعددة، بدءًا من متطلبات الحوسبة والذاكرة إلى موارد وحدات معالجة الرسوميات (GPUs) والتنفيذ، بينما ينبغي الحفاظ على زمن الاستجابة (Latency) وسرعة المعالجة (Throughput).

على الرغم من أن الأبحاث السابقة قدمت تقنيات وأطر عمل لكل من تحسين وتأدية نماذج اللغات الضخمة، إلا أن القليل معروف عن كيفية اعتماد هذه الأساليب بشكل عملي. في هذه الدراسة، قمنا بتحليل استخدام أطر خدمة نماذج اللغات الضخمة في الأنظمة البرمجية ذات المصدر المفتوح. تم التعرف على خمسة أطر محددة لهذه النماذج وهي: vLLM، SGLang، TensorRT-LLM، LMDeploy، وFlashInfer.

قمنا بفحص كيفية اعتماد هذه الأطر والتقنيات بشكل فردي ومجتمعي، وكيف تختلف معدلات الاعتماد عبر فئات نماذج اللغات الضخمة. أظهر تحليلنا أن إطار vLLM هو الأكثر شعبية من حيث الاعتماد، بينما تعتبر تقنيات الحوسبة المتوازية وإدارة الذاكرة من بين الأكثر استخدامًا في فئات أساليب الخدمة.

يظهر أيضًا أن استخدام أطر متعددة محدود، مما يشير إلى أن المطورين يعتمدون غالبًا على إطار واحد فقط، على الرغم من أن الجمع بين أطر العمل يتصل بالقدرات التكاملية عبر مجموعة الخدمة.

كما تتباين معدلات اعتماد الأطر طبقًا لعائلات النماذج، وأحجامها، وتخصصاتها، وإعدادات انتشارها. يقدم تحليل مستوي المستودع أن أطر خدمة نماذج اللغات الضخمة تدعم التطبيقات والهياكل المعمارية، بما في ذلك التعلم المعزز (Reinforcement Learning - RL) والجيل المتعدد الوضع (Multimodal Generation) والفهم، بالإضافة إلى الخدمات المصغرة (Microservices) والبنية التحتية السحابية (Cloud Infrastructure).

بشكل عام، تزود هذه الدراسة بمساحة شاملة للأعتماد العملي لأطر خدمة نماذج اللغات الضخمة، كما تقدم رؤى قيمة للباحثين ومطوري الأطر والممارسين العاملين على الأنظمة المعتمدة على الـ LLM.