في عالم معالجة اللغة الطبيعية (NLP)، يعد الكشف عن الشذوذ النصي (Text Anomaly Detection) مهمة حيوية حيث يمكن تطبيقه في مجالات عديدة مثل كشف الاحتيال، تحديد المعلومات المضللة، والتعامل مع الرسائل المزعجة. لكن إلى جانب التقدمات الكبيرة في نماذج اللغات الضخمة (LLMs) وتقنيات الكشف عن الشذوذ، كان هناك نقص ملحوظ في المعايير القياسية الشاملة لفحص تقنيات الكشف عن الشذوذ في البيانات النصية.

تجري هذه الدراسة البحثية الجديدة دراسة شاملة وتقدم مؤشراً يحتفي بالكشف عن الشذوذ النصي من خلال الاستفادة من النماذج اللغوية المدربة مسبقًا. تشمل البيانات المختارة كنماذج لغوية عالية الأداء مثل GloVe، BERT، LLaMA-2 وLLaMA-3، فضلاً عن نماذج OpenAI.

وقد أظهرت التجارب أن جودة التضمين (Embeddings) تلعب دورًا حاسمًا في فعالية الكشف عن الشذوذ، حيث لم تظهر approaches المعتمدة على التعلم العميق (Deep Learning) أي ميزات أداء أفضل مقارنة بالخوارزميات التقليدية مثل KNN وOCSVM عند استخدام التضمينات المستمدة من نماذج اللغات الضخمة. كما تم الكشف عن خصائص انخفاض الرتبة بشكل قوي في مصفوفات الأداء عبر النماذج، مما يتيح اتخاذ استراتيجيات فعالة وسريعة في تقييم النماذج واختيارها في التطبيقات العملية.

الجدير بالذكر أن فريق البحث قام بمشاركة مجموعة أدوات المؤشر هذه للجمهور، مما يساهم في فتح آفاق جديدة للبحث في أنظمة الكشف عن الشذوذ النصي القوية والقابلة للتوسع.

هل تتوقع أن تُحدث هذه المعايير الجديدة ثورة في مجال معالجة النصوص؟ شاركونا آرائكم في التعليقات!