في عالم الذكاء الاصطناعي، تُعتبر نماذج اللغة الكبيرة (Large Language Models) من الأدوات الأساسية التي تعتمد عليها العديد من التطبيقات اليوم. ولكن، كيف نضمن أمان هذه النماذج وتوافقها مع المعايير الأخلاقية؟ هذا هو السؤال الذي طرحه باحثون من خلال دراسة جديدة تدور حول أثر سلوكيات تعديل النموذج (Supervised Fine-Tuning - SFT) في هذه النماذج.

تُظهر الدراسة أن السلوكيات الضارة الناتجة عن تعديلات النموذج تُخلف آثارًا دائمة تُظهر تأثيراتها في تحديثات النقاط المرجعية. استخدم الباحثون نظام إحداثيات يتتبع تركيبة الأهداف الضارة عن طريق رابط قوي مع السلوكيات المشبوهة، مع نتائج تتراوح بين 0.986-0.992 عبر نماذج تتراوح قدرتها من 7 إلى 8 مليارات محرك.

ولقد طُورت تقنية بعنوان TRACE، والتي تسمح بتحديد تحديثات النقاط المرجعية غير المعروفة بالنسبة إلى نماذج مرجعية ضارة وغير ضارة، من دون الحاجة للوصول إلى بيانات SFT الأصلية. هذه التقنية تُمكن الباحثين والمطورين من إجراء مراجعات دقيقة وفعالة للسلامة، دون الحاجة لتشغيل النموذج أو الحصول على بيانات إضافية.

تتطلب TRACE فقط تحديثات النقاط المرجعية للتحليل، مما يجعلها أسهل في الاستخدام وبالتالي حلاً فعالاً لمراجعة نماذج الذكاء الاصطناعي.

من المثير أن النتائج تشير إلى أن TRACE تبقى مستقرة حتى مع اختلافات كبيرة في البيانات والتكوينات المختلفة. ويتبين أنها تقدم إشارة مفيدة في حالات عدم توفر تقييمات السلوك السليمة، مما يعزز من سلامة التطبيقات التي تعتمد على هذه التقنيات.

ما رأيكم في كيفية تأثير سلوكيات تعديل النموذج على سلامة النماذج اللغوية؟ هل تعتقدون أن هذه التقنيات يمكن أن تنقذنا من المخاطر المستقبلية؟ شاركونا في التعليقات.