في عالم الذكاء الاصطناعي، يمثل استهلاك الذاكرة أحد العناصر الحيوية في تحسين أداء النماذج. توضح الدراسة الجديدة (arXiv:2608.15117v1) كيفية تحليل نماذج استهلاك VRAM (Virtual Random Access Memory) للذكاء الاصطناعي أثناء عملية الاستدلال، حيث ينقسم الاستهلاك إلى ثلاثة مكونات رئيسية: تخزين الأوزان، ذاكرة KV-cache، وأبعاد التفعيل، وذلك بشكل موجه بناءً على عدد الخطوات، واستدعايات الأدوات، وتوسيع السياق.
ركزت الدراسة بشكل خاص على وكيل سابقي الاستدلال باستخدام نموذج LangGraph ونموذج CUDA لتوليد الأكواد (AgentK) مع عائلة تقنيات الكمي 4-bit (Q4 K M) على جهاز NVIDIA H100 GPU. من خلال تحليل دقيق لأداء الذاكرة عبر 1,920 مسار، توصل الباحثون إلى ملاحظتين رئيستين.
الأولى هي أن النماذج التحليلية المغلقة تحقق دقة تنافسية عندما يتم تزويدها بثوابت تجريبية معروفة: VRAM المستخدم في الأوزان وذروة ذاكرة التفعيل. عند توفير قراءات GPU الحية وبيانات المسار الحقيقية، يتطابق النموذج التحليلي أو يتخطى أفضل النماذج المتعلمة لدى ثلاثة من النماذج الأربعة، مع اختلاف دقيق في النسبة الخطأ المطلوب (MAPE) يتراوح بين 2.2 إلى 4.4%.
الملاحظة الثانية تشير إلى أن نجاح الترجمة البرمجية يعتمد بشكل صارم على سعة النموذج، حيث تتراوح النسب من 5.7% لنموذج Phi-4-mini إلى 62.0% لنموذج Qwen2.5-Coder-14B. مما يعني أن قدرة توليد الأكواد لا تزال مقيدة بقدرات نماذج الذكاء الاصطناعي بدلاً من المساحة المتاحة في الذاكرة.
علاوة على ذلك، تظهر البيانات أن تباين ذروة الذاكرة العامة منخفض بشكل ملحوظ عبر جميع النماذج (CV 0.3-9.4%)، مما يجعل تحسينات الانحدار المستندة إلى الميزات غير ذات دلالة إحصائية مقارنة بالنموذج الثابت. لذلك، لا تجد الدراسة مبرراً للاعتماد على نماذج توقع الذاكرة المعقدة في البيئات الكمية التي تهيمن عليها الأوزان. وقد أتاح الباحثون النسخة المعتمدة من البحث والدليل لدعم عمليات النسخ المتماثل.
تحليل الوكيل الكمي: استقرار VRAM وتوقعات في بيئات العمل الذكية
تتناول الدراسة نموذج استهلاك VRAM للذكاء الاصطناعي، موضحة كيفية تفكيك ذاكرة البطاقة إلى ثلاثة مكونات مهمة. النتائج تظهر أن النماذج التحليلية قادرة على تحقيق دقة تنافسية عند استخدام ثوابت تجريبية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←# VRAM# الذكاء الاصطناعي# نموذج LangGraph# CUDA# توليد الأكواد# نموذج Phi-4-mini# نموذج Qwen2.5-Coder-14B
جاري تحميل التفاعلات...
