تشهد نماذج الذكاء الاصطناعي، وخاصة النماذج اللغوية الكبيرة (Large Language Models) ونماذج اللغة البصرية (Visual Language Models)، نمواً مطرداً في التطبيقات والقدرات. ومع ذلك، أصبحت آليات الانتباه (Attention Mechanisms) تعتبر من أبرز نقاط الاختناق الحاسوبية، نظراً لتعقيدها العالي في استهلاك الذاكرة والوقت. على الرغم من اقترح العديد من البدائل الفعالة، إلا أنه لا يوجد تقييم دقيق لاستخدام الطاقة الفعلي والموارد المادية خلال مرحلة التدريب.

في دراسة جديدة، تم تقييم ثمانية آليات انتباه أثناء تدريب نموذج GPT-2، مع قياس مؤشرات رئيسية تشمل وقت التدريب، واستخدام الذاكرة على وحدات معالجة الرسوميات (GPU)، وFLOPS (فلاوبيرينغ Operations Per Second)، واستخدام وحدة المعالجة المركزية (CPU)، واستهلاك الطاقة. وكشفت النتائج أن آليات الانتباه التي تحتوي على تنفيذات نواة محسنة مثل Flash Attention وLocality-Sensitive Hashing (LSH) Attention وMulti-Head Latent Attention (MLA) حققت أفضل كفاءة في استخدام الطاقة.

علاوة على ذلك، بينت الدراسة أن انخفاض استهلاك الطاقة على وحدات معالجة الرسوميات لا يضمن بالضرورة تقليل إجمالي استهلاك الطاقة، حيث يلعب وقت التدريب دوراً حيوياً أيضاً. لذا، يسجل هذا البحث أهمية التقييم الواعي للطاقة في تصميم آليات الانتباه، مما يقدم رؤى عملية للاختيار بين الآليات ذات الكفاءة العالية في استخدام الموارد.

يمكنك الاطلاع على الأكواد المستخدمة في الدراسة على GitHub، مما يتيح للباحثين والمطورين استكشاف النتائج واستغلالها في تطبيقاتهم الخاصة.