في عالم الذكاء الاصطناعي، تمثل نماذج اللغة الضخمة (Large Language Models) أصولًا عالية القيمة يمكن اشتقاقها عبر إعادة التوزيع أو التخصيص أو الكمّية. وتعد هذه النماذج صعبة التحقق من ملكيتها لأنها غالبًا ما تكون متاحة فقط من خلال واجهات برمجة التطبيقات، مما يستدعي الاعتماد على استجابات نصية في ظروف غامضة.
لإيجاد حل لهذه التحديات، تم اقتراح إطار مبتكر يسمى "طباعة بصمات مضادة مستهدفة" (Targeted Counterfactual Fingerprinting أو TCF). هذا الإطار يهدف إلى تحويل المقارنات من توليد نصوص مفتوحة النهاية إلى أسئلة مضبوطة تركز على نقل المضامين المضادة. ويعمل TCF على تقييد كل استفسار تحقق ضمن مجال إجابات محدود، مما يقلل من الغموض في نتيجة التحقق.
ويقوم TCF بتحسين perturbation على سؤاله ليكون مختلفًا عن الإجابة النظيفة للنموذج المحمي على السؤال الأصلي. عبوة التحقق تتلخص في التحقق مما إذا كانت الإجابة النهائية للنموذج المشبوه تتطابق مع الهدف المسجل.
تقديم كمية الهامش المضاد للنموذج المصدر (Source-Model Counterfactual Margin أو SCM) يضمن أن الهدف غير محتمل قبل التغير ومحتمل بعده. من خلال السيطرة على اختيار الهدف، وإيقاف التغير، وتنقية البصمات، يقدم الإطار الجديد تعديلات قابلة للقياس.
وعند تطبيق هذا الإطار على أربع عائلات من نماذج اللغة الضخمة، استطاع TCF تحقيق متوسط AUC قدره 0.9861، مما يشير إلى تحسينات كبيرة مقارنةً بأساليب سابقة مثل TRAP وProFLingo وZeroPrint.
تحقق ملكية نماذج اللغة الضخمة: ابتكار طباعة بصمات مضادة مستهدفة!
تقدم دراسة جديدة إطار عمل مبتكر للتحقق من ملكية نماذج اللغة الضخمة (LLMs) باستخدام طباعة بصمات مضادة. هذا يحقق دقة عالية في التحقق على الرغم من القيود على ردود الأفعال في البيئات السوداء.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
