في ظل التقدم السريع في مجال الذكاء الاصطناعي، برزت تقنية جديدة تعرف باسم تحسين التعليمات التعاونية النصية (Textual Collaborative Prompt Optimization - TCPO)، والتي تسعى إلى تحسين أداء النماذج اللغوية الكبيرة (Large Language Models - LLMs) بطريقة لامركزية. لكن يكمن الخطر في أن هذه التقنية تعاني من ثغرة أمنية جديدة تتعلق بهجمات حقن التعليمات.
تسهم هذه الثقافة الابتكارية في توسيع نطاق استخدام التعليمات اللغوية من خلال السماح للعديد من المستخدمين بتحسين التعليمات بشكل جماعي دون الحاجة لنقل البيانات إلى خوادم خارجية، حيث تظل البيانات محلية. لكن الأمر الذي يجعل TCPO عرضة لهجمات حقن التعليمات هو اعتماده على تحديثات نصية حرة الشكل، مما يتيح إمكانية إدخال تعليمات خبيثة في التعليمات المحلية.
وفي هذا السياق، تم اقتراح نموذج هجوم جديد يُعرف بـ CPInj، والذي يستهدف الحلقة التعاونية في TCPO. تتمثل خطورة هذا الهجوم في قدرة التعليمات الخبيثة على التغلغل في التعليمات العالمية المجمعّة، مما يؤدي إلى تدهور أداء المهام اللاحقة. بالإضافة إلى ذلك، فإن الدفاعات الموجودة حالياً لم تتمكن من التصدي لهذا النوع من الهجمات.
ولتقليل تأثير هذا الهجوم، اقترح الباحثون طريقة جديدة للإجماع الدفاعي تُعرف باسم APAgg، التي تهدف إلى تنقية التعليمات الخبيثة واستعادة بعض جدوى TCPO. وقد أجريت تجارب موسعة عبر ثلاث عائلات من أنظمة LLM وخمسة مهام تحليلية في مجالات الرياضيات والمنطق والطب لرصد فعالية الهجوم.
تظهر النتائج أن الهجوم يكشف عن ضعف حرج في آليات التحسين التعاونية، مما يبرز الحاجة إلى تطوير دفاعات أكثر قوة ضد مثل هذه التهديدات. ورغم الجهود المبذولة، لا يزال من الممكن أن تبقى هذه الهجمات فعالة، مما يستدعي تركيزاً أكبر على تحسين آليات الدفاع.
ما رأيكم في هذه الثغرات الأمنية الحديثة؟ شاركونا آراءكم في التعليقات.
كشف المخاطر: هجوم حقن التعليمات في تحسين النصوص التعاونية للذكاء الاصطناعي
يكشف CPInj عن ثغرة خطيرة في نظام تحسين التعليمات التعاونية للنماذج اللغوية الكبيرة، مما يتيح هجمات حقن تعليمات خبيثة. رغم الجهود المبذولة في الدفاع، إلا أن هذه الهجمات تظل فعالة وتتطلب Solutions أكثر قوة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
