تعد مشكلات تكوين السحابة أحد الأسباب الرئيسية للحوادث الأمنية، وهذا ما يجعل من الضروري التحقق مما إذا كانت نماذج اللغات الكبيرة (Large Language Models) والنماذج الصغيرة (Small Language Models) تستطيع إنتاج كود بنية تحتية آمن. أجرت دراسة جديدة تقييمًا لسبعة نماذج في هذا السياق، بما في ذلك ثلاثة نماذج مغلقة هي كل من (Claude Opus 4)، (GPT-5.4)، و(Gemini 2.5 Pro)، بالإضافة إلى أربعة نماذج مفتوحة تتمثل في (Qwen2.5-Coder-14B)، (WizardCoder-33B)، (CodeLlama-13B)، و(Magicoder-S-CL-7B).
تصدرت هذه النماذج الاختبار باستخدام منصة AWS لتوليد كود Terraform عبر 17 سيناريو مختلف، مع دمج أدوات فحص الأمان (Checkov) و(Trivy) في أنبوب التكامل المستمر (CI/CD) الخاص بـ GitLab، بالإضافة إلى تقييم استراتيجيتين مختلفتين للإدخال في ثلاث مستويات أمنية.
أظهرت النتائج أن فعالية السنتاتكتية والامتثال الأمني هما خاصيتان تختلفان تمامًا في كود البنية التحتية المُنتج بواسطة نموذج الذكاء الاصطناعي. حيث قد يقوم نموذج بإنتاج كود جيد الشكل دون أن يحقق الأمان المطلوب. على سبيل المثال، حقق نموذج (WizardCoder-33B) معدل تحقق يصل إلى 77.8% لكنه لم يمتثل لأي من معايير (Checkov)، بينما حصل نموذج (Claude Opus 4) على 23.1% من امتثال (Checkov) و92.5% من نجاح (Trivy) تحت إدخال أمني مفصل.
تشير النتائج إلى أن الاعتماد على هندسة الإدخالalone غير كافٍ، ولكنه يعكس أهمية استخدام الأدوات الآلية المتعددة في فحص الأمان وبدعم من نماذج الذكاء الاصطناعي، بغض النظر عن نوع النموذج أو استراتيجيات الإدخال المستخدمة. وبالتالي، يبقى الحفاظ على الأمان في تكوين السحابة أمرًا يتطلب المزيد من الجهود والاستراتيجيات المتعددة.
إذا كان لديك أفكار أو تجارب حول كيفية تحسين الأمن في بيئات السحابة، فلا تتردد في مشاركتها معنا في التعليقات!
تقييم أمان مبتكر: كيف تقيس نماذج الذكاء الاصطناعي قدرتها على توليد كود بنية تحتية آمن؟
تسعى التجارب الحديثة لاختبار مدى قدرة نماذج الذكاء الاصطناعي على توليد كود بنية تحتية آمن، حيث يقدم البحث تحليلاً لسبعة نماذج مختلفة. هل تحقق هذه النماذج المعايير الأمنية المطلوبة؟
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
