في عالم سريع التطور من الذكاء الاصطناعي، تمثل نماذج اللغات الضخمة (Large Language Models) إحدى النقاط المحورية التي تستدعي الكثير من البحث والاهتمام. وُجد في دراسة جديدة منشورة على arXiv أن الاعتماد على صيغ سطحيّة واحدة لتقييم سلوك هذه النماذج قد يؤدي إلى تقليل التقدير الحقيقي لمخاطر الأمان المحتملة.
تسعى الدراسة إلى الإجابة على سؤال مهم: هل تعكس هذه القياسات النوايا الحقيقية للنموذج عند اختلاف صيغ الأسطح ولكن الحفاظ على المعنى؟ من خلال اختبار 370 نموذجًا مختلفًا مع خمسة صيغ سطحية لكلٍ منها، تمكّن الباحثون من استنتاج أن بعض الصيغ السطحية قد تكون أكثر خطورة من غيرها، مع إدراك أن متوسط الأمان قد يكون مضللًا.
كشفت النتائج أن الاعتماد فقط على الصيغ السطحية القياسية يقلل من تقدير المخاطر غير الآمنة، وأن التباينات في الأسطح لها تأثير كبير على السلامة. ويعني ذلك أن 5 إلى 13% من النماذج التي تعد آمنة وفقًا للصيغ القياسية يمكن أن تكون غير آمنة عند إعادة صياغتها.
التقنيات المستخدمة في الدراسة تتضمن تحويلات دقيقة مقبولة وقابلة للاستخدام، مما يعطي فكرة عن أهمية تحديد المخاطر بدقة عند التعامل مع نماذج اللغات الضخمة. يعتبر هذا الاكتشاف داعمًا قويًا للوضع الحالي لأبحاث أمان الذكاء الاصطناعي ويحذر من القيود المفروضة على التقييمات التقليدية. في ظل هذه النتائج المثيرة، يعد إطلاق مجموعة البيانات والشفرة الخاصة بالبحث خطوة مهمة نحو تحسين أمان الذكاء الاصطناعي.
اكتشاف جديد: الأسطح المتعددة لنماذج اللغات الضخمة تكشف عن مخاطر غير متوقعة في الأمان
كشف بحث حديث عن أن القياسات المعتمدة على صيغ سطحية واحدة لنماذج اللغات الضخمة (LLMs) قد تقلل من تقدير السلوك غير الآمن لهذه النماذج. النتائج أظهرت أن التنويعات في الأسطح تؤثر بشكل كبير على تقييم الأمان، مما يستدعي إعادة التفكير في طرق التقييم الحالية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
