في عالم الذكاء الاصطناعي، يعد الأمان الرقمي أحد أهم القضايا التي يتعين معالجتها، وخصوصاً عند التعامل مع الملفات بصيغة PDF. غالباً ما يقوم نظام نماذج اللغات الكبيرة (Large Language Models) بتبسيط بيانات PDF قبل أن تبدأ أنظمة الحماية بفحصها، مما قد يؤدي إلى فقدان معلومات مهمة حول التعليمات الموجهة. وهنا تأتي أهمية CrackedPDFs، معيار جديد صُمم لتقييم اختراق التعليمات الخفية في ملفات PDF.

تتكون مجموعة البيانات التي تعتمدها CrackedPDFs من 29,322 ملف PDF تم توليدها من 4,983 وثيقة أساسية. تتضمن المجموعة 9,774 ملفاً تم حقن التعليمات به، بالإضافة إلى 19,548 ملفاً تمثيلياً أو متداخلاً. في إطار هذا التقييم، تم فحص أداء كل من PromptGuard وأيضاً نموذج يعتمد على القواعد.

قمنا أيضاً بتقييم نماذج تعتمد على الهيكل فقط وكاشف هجين منقي، واستخدمنا انقسامات موثوقة من مصادر البيانات ومراقبة مزدوجة. وكانت النتائج مثيرة للإعجاب، حيث حقق الكاشف الهجين دقة 0.960 وفقًا لمقياس F1، بينما كانت قياسات ROC-AUC وPR-AUC 0.998 و0.997 على التوالي.

ومع ذلك، يجب أن نتذكر أن هذه النتائج لا تعكس قوة الأداء في العالم الواقعي أو القدرة على التعرف عبر عائلات مختلفة من الملفات. ولكن تقدم CrackedPDFs خطوة مهمة نحو تعزيز أمان الوثائق في عصر تتزايد فيه التهديدات الرقمية.