في عالم الذكاء الاصطناعي، تزداد استخدامات نماذج رؤية-لغة (Vision-Language Models) بشكل متزايد، لاسيما في البيئات التي تتطلب الحفاظ على الخصوصية. حيث تُستخدم هذه النماذج في تطبيقات متطلبات الأمان وقيود الشبكة. ومع ذلك، فإن إرسال جميع التوكنات البصرية عبر نماذج هذه الأطر قد يؤدي إلى تكاليف باهظة والتهديد بكشف المعلومات الحساسة.
في هذا السياق، تم تقديم QPriv-VL، وهو إطار عمل مبتكر يعتمد على توجيه الأسئلة، يهدف إلى حفظ الخصوصية من خلال تقليل عدد التوكنات المرسلة بناءً على فائدة المهمة وحساسية الخصوصية. يعتمد جوهر هذا الإطار على خوارزمية خفيفة تُعرف بمُتنبئ العتبة الديناميكية (Dynamic Threshold Predictor - DTP)، التي تقوم بتقدير نسبة التقليم المخصصة لكل عينة إضافةً إلى قناع الاحتفاظ على مستوى التوكن في عملية مرور واحدة.
من خلال دمج دلالات السؤال المستخرجة من التشابه بين المقاطع البصرية ونسخة السؤال المجمعة، ويستند DTP أيضًا إلى إشارة حساسية مستمدة من ميزات DINOv2 المجمدة. هذا يمكن النموذج من تجاهل المناطق الحساسة مع الحفاظ على المقاطع المفيدة التي تُستخدم للإجابة على الأسئلة، دون الحاجة إلى علامات حساسية محددة.
تم تقييم QPriv-VL مقابل عدة مجموعات بيانات مثل GQA وOK-VQA وVQAv2 وأيضًا في مواجهة أربعة عائلات من هجمات الخصوصية. النتائج تشير إلى أن DTP لا يكتفي بتحسين نسبة تقليم الثوكنات، بل أيضًا يستخدم أقل عدد ممكن من التوكنات المرسلة مع الحفاظ على دقة عالية في إجابات أسئلة المستخدم.
الأبحاث أظهرت أن نموذج QPriv-VL خفض نجاح هجمات استنتاج العضوية من 0.99 إلى 0.76-0.79. كما أنه أدَّى إلى تقليل PSNR للتجميعات من هجمات FSHA وFORA مقارنةً بالتقليم ذو النسبة الثابتة، بينما حافظ على دقة مرضية للإجابات حوالي 40% من ميزانية التوكنات الأصلية.
ما يميز هذه التقنية هو أنها تحافظ على المقاطع الحساسة بشكل تفضيلي، مما يشير إلى أن النموذج يركز على الاستجابة لفهم السؤال بدلاً من التركيز على الأهمية البصرية العامة. هذه التقنيات الجديدة تمثل خطوة مثيرة نحو تحقيق التوازن بين الأمان والدقة في نماذج الذكاء الاصطناعي.
لا ترسل ما لا تحتاجه: إطار عمل ثوري لحماية الخصوصية في نماذج رؤية-لغة!
تقدم الدراسة الجديدة QPriv-VL، إطار العمل القائم على الأسئلة والذي يساعد في تقليل نقل المعلومات الدقيقة عبر نماذج رؤية-لغة لتقليل نسبة الهجمات على الخصوصية. هذه التقنية توازن بين الأمان ودقة الإجابات بكفاءة عالية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
