في دراسة جديدة نُشرت على منصة arXiv، تم توسيع نموذج توازن ذاكرة التنسور (TME) الذي يتناول معالجة البيانات باستخدام تقنية FP8. كان الجديد في هذه الدراسة هو إضافة ما يُعرف بـ "تكلفة تفكيك البقايا"، والتي كان من المُغفل عنها سابقًا في النموذج الأصلي.
نموذج "FP8 هو كل ما تحتاجه" (FP8 is All You Need) تم تطويره لتحقيق أقصى كفاءة في تنفيذ العمليات الحسابية، لكن جوانب معينة من الأداء كانت تُعتبر دون النظر إلى الجوانب التخريبية.
مع تنفيذ مخطط "أوزاكي الثاني" (Ozaki Scheme II) لإعادة المحاكاة، كانت الطريقة تركز على مصطلح أساسي للتنسور وآخر لحركة الذاكرة عالية النطاق. لكن الآن، تم إدراج مصطلح رابع يتناول تكلفة إلغاء البناء لكل إدخال، مما يزيد التعقيد العام للنموذج.
الأهم من ذلك، قامت الدراسة بتحديد معايير معينة - بما في ذلك العتبة التشغيلية "OI^{*}"، حيث لم تعد عمليات المحاكاة قادرة على منافسة الأداء الأصلي لنموذج FP64، متى ما كانت تلك العتبة تحت المستويات المحددة. على سبيل المثال، تم قياس عتبة الأداء الوظيفي على وحدة معالجة الرسوميات NVIDIA B300 لتكون حوالي 0.56 FLOP/B.
بهذه الإضافة، يُظهر التحليل أن التكاليف الفعلية لأداء العمليات الحسابية مثل GEMV وSpMV أصبحت أدنى مما كان متوقعًا، مع الأداء المسجل على مستويات تتراوح بين 0.3-0.9x من الأداء الأصلي بدلاً من التحسينات الموعودة.
عليه، تؤكد هذه الدراسة على أهمية مراعاة جميع العناصر في نماذج الأداء، مما قد يطرح أيضًا تساؤلات حول كيفية تأثير تخزين القيم مسبقًا على عرض النطاق الترددي للتطبيقات المستقبلية. هل تعلم أن القراءة العميقة لنماذج الأداء يمكن أن تكشف الكثير عن قيود التقنية الحالية؟ شارك رأيك في التعليقات!
كسر الحد الأقصى: كيف يؤثر مصطلح "تكلفة تفكيك البقايا" على نموذج توازن ذاكرة التنسور
شهد نموذج توازن ذاكرة التنسور (TME) إضافة جديدة تعزز فهم الأداء. يتمثل ذلك في تقديم متغير "تكلفة تفكيك البقايا"، الذي يلقي الضوء على قيود التنفيذ التي قد تحد من كفاءة العمليات الحسابية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
