في خطوة رائدة نحو تحسين أمان وخصوصية أنظمة الذكاء الاصطناعي، تم الكشف عن تقنية جديدة تسمى "مراجعة العضوية شبه السوداء" (Source-aware Membership Audit - SMA). هذه التقنية تعالج القضايا المرتبطة بتسرب الخصوصية في الأنظمة المعتمدة على توليد المحتوى المعزز بالاسترجاع (Retrieval-Augmented Generation - RAG) والتي تتسم بتعقيد كبير في تحديد مصادر البيانات المستخدمة.

تعتمد تقنيتا RAG و MRAG (Retrieval-Augmented Generation متعددة الوسائط) على دمج مصادر المعرفة الخارجية، مما يحسن من تغطية المعرفة والفهم السياقي لنماذج اللغات الضخمة (Large Language Models - LLMs). وإن كان هذا يعد تقدمًا ملحوظًا، إلا أنه يأتي مع تحديات كبيرة تتعلق بمسؤولية تسرب البيانات. فقد أظهرت الدراسات أن الفشل في تحديد مصدر المحتوى الناتج يجعل تقنيات الاستنتاج العضوي غير قادرة على نسب المخرجات بشكل موثوق إلى البيانات التي تم التدريب عليها أو الاسترجاع الخارجي أو إدخال المستخدم.

لحل هذه المشكلات، تم ابتكار SMA، التي تتيح نسبة دقيقة لمصادر المحتوى الناتج في بيئة شبه سوداء مع قدرات التحكم في الاسترجاع. كما أنها تتضمن آلية لتقدير النسبة تعتمد على تحسين من الدرجة الصفرية، مما يعزز من موثوقية التقديرات من خلال نمذجة الانحدار المتصاعد (ridge regression) والتجريب على نطاق واسع.

إضافة إلى ذلك، تقدم SMA تقنية الانتساب بين الأنماط، حيث تُترجم مدخلات الصورة إلى أوصاف نصية باستخدام نماذج اللغة متعددة الوسائط، مما يُتيح نسبة عند مستوى العلامة في نمط النص. هذه الخطوة تسهم لأول مرة في تمكين استنتاج العضوية بناءً على آثار استرجاع الصور في أنظمة MRAG.

تُغيّر هذه التقنية بوضوح من التركيز المعتاد في استنتاج العضوية من "ما إذا كانت البيانات قد تم حفظها" إلى "من أين يأتي المحتوى"، مما يوفر منظورًا جديدًا لمراجعة أصول البيانات في أنظمة التوليد المعقدة. هل ستحل هذه التقنية الجديدة محل أساليب الأمان التقليدية، أم أن الزمن سيثبت عكس ذلك؟ تابعونا للمزيد من التحديثات.

ما رأيكم في هذه التطورات الجديدة؟ شاركونا آراءكم في التعليقات!