في زمن تزايد استخدام نماذج اللغات الضخمة (Large Language Models) في التطبيقات المختلفة، تظهر تحديات جديدة تتعلق بتأخير الاستجابة التي تؤثر على التكلفة والكفاءة التشغيلية. يسلط بحث حديث الضوء على استراتيجيات جديدة لهجمات تأخير الاستجابة، حيث يأتي التركيز هذه المرة على نظام الخدمة بدلاً من النموذج نفسه.

تعرض الدراسات السابقة ما يعرف بـ "هجمات التأخير" (Latency Attacks)، والتي تركز على تصميم مدخلات تؤدي إلى أطوال مخرجات تزيد من التأخير. ومع ذلك، أظهرت الدراسات الحالية أن هذه الهجمات فعّالة بشكل محدود ضد أنظمة الخدمة الحديثة لنماذج اللغات الضخمة.

يكشف البحث الجديد عن كيفية استخدام تحسينات على مستوى النظام، مثل التجميع المستمر (Continuous Batching)، لتوفير عزل منطقي يقلل من تأثير التأخير على المستخدمين المشتركين. وبالتالي، توجه الدراسة تركيزها نحو استراتيجيات جديدة مثل "هجمة الملء والضغط" (Fill and Squeeze Attack) والتي تستهدف انتقال الحالة للجدولة.

تبدأ استراتيجية "الملء" بإفراغ ذاكرة التخزين المؤقت (Cache) العالمية، مما يؤدي إلى حظر مؤقت للأوامر، بينما تضغط "الضغط" النظام للعودة إلى حالة التكرار.

عبر التلاعب في أطوال المخرجات باستخدام مدخلات هجوم مختلفة، وإجراء اختبار جانبي لحالة الذاكرة، أثبت الباحثون أن الهجوم يمكن أن ينجح في سياق عملي بقيمة تكلفة أقل. كما أظهرت التقييمات الشاملة على النموذج "vLLM" انخفاضًا يصل إلى 75-742 مرة في زمن الاستجابة مقارنة مع نماذج السلامة المعروفة، بالإضافة إلى 1.5-4 مرات تباطؤ متوسط في الوقت لكل رمز مخرج، بتكلفة هجوم أقل بمقدار 30-40%.

إذا كنت مهتماً بتقنيات الأمان ومستقبل نماذج اللغات الضخمة، فإن هذا البحث يفتح أفقاً جديداً لفهم كيفية تأثير الأنظمة على الأداء والكفاءة. كيف ترون مستقبل الأمان في استخدام نماذج اللغات الضخمة؟ شاركونا آرائكم في التعليقات!