في عالم الذكاء الاصطناعي، تعتبر نماذج اللغة الضخمة (Large Language Models) أدوات قوية، ولكنها ليست محصنة أمام بعض الثغرات. دراسة جديدة تعرضت لتأثير "الرواية" أو "المربعات السردية" على قدرة هذه النماذج على رفض الطلبات الضارة.
تشير الأبحاث إلى أن النماذج المصممة لضمان السلامة تميل إلى رفض الطلبات الضارة عندما تؤثر عليها بشكل مباشر، بينما تتجاوب بشكل مختلف عندما تُصاغ الطلبات ضمن إطار سردي أو تمثيلي.
البحث، الذي شمل تقييمات عبر عدة لغات، أظهر أن نموذج Qwen3-1.7B تجاوزت نسبة النجاح في الهجمات المباشرة 89.4% باللغة الإنجليزية، و93% بالصينية الحديثة، و95.7% بالصينية الكلاسيكية. يمثل هذا النمط من الثغرات تحديًا كبيرًا لتصميم نماذج أكثر أمانًا.
لتعزيز الفهم حول هذه الظاهرة، تم تطوير مجموعة مؤشرات جديدة تُعرف باسم GUISE، وهي معيار يهدف إلى دراسة هذه الثغرات بشكل منهجي. تضم هذه المجموعة طلبات متوازية بين عدة لغات وأنواع مختلفة من الطلبات الضارة والغير ضارة.
كشفت التحليلات التمثيلية أن استخدام الأساليب السردية يجعل النماذج تتحرك بعيدًا عن اتجاهات الرفض، مما يفسر النتائج المذهلة لهذه الدراسة. ولضمان أقصى درجات الأمان، تم اقتراح نظام AXIS، الذي يجمع بين تحسين التفضيلات والمبادئ التوجيهية لتعديل استجابة النماذج، مما يجعلها ترفض الطلبات الضارة بشكل كامل بدلاً من تقديم إجابات تحذيرية.
من خلال تقييم نماذج مثل Qwen3-1.7B وQwen3-4B وGLM-4-9B، أثبت نظام AXIS أنه يمكن أن يُحقق أعلى درجات الأمان وسهولة الاستخدام بالمقارنة مع الأساليب التقليدية، مما يمهد الطريق نحو مستقبل أكثر أمانًا في مجال الذكاء الاصطناعي.
كيف تؤثر الروايات على رفض نماذج الذكاء الاصطناعي؟ دراسة جديدة تكشف النقاب!
تتطرق دراسة حديثة إلى كيفية تأثير الأساليب السردية في طلبات الذكاء الاصطناعي، حيث تحقق نماذج لغوية نتائج متغيرة بين الرفض والقبول. تعرفوا على المعايير الجديدة التي تم تطويرها لفهم هذه الظاهرة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
