تسجل اللغة العربية انطلاقة قوية نحو المستقبل، حيث تُظهر التقنيات الحديثة القدرة على التعامل مع المحتوى الضار بشكل فعال وفريد. تحت هذا السقف، أُعلن عن إطلاق مجموعة بيانات AraDetox، والتي تعد خطوة طموحة في معالجة لغة الضار في العالم العربي.

تتكون مجموعة بيانات AraDetox من 10,500 منشور ضار من منصات التواصل الاجتماعي المختلفة، بالإضافة إلى 84,000 إعادة كتابة مُنقاة تم إنشاؤها باستخدام نماذج الذكاء الاصطناعي المتطورة مثل GPT-5 وGemini 2.5 Flash. تمثل هذه المجموعة تعدد اللهجات العربية، حيث تشمل الكتابات باللغة العربية الفصحى، واللهجات الخليجية، والشامية، والمصرية.

تحمل النتائج التي تم التوصل إليها في هذا المشروع رؤى مثيرة، حيث تظهر التقييمات البشرية والتحليلات التلقائية قدرة أنظمة الذكاء الاصطناعي على الحفاظ على المعاني الأساسية للنصوص بينما تقوم بإزالة التعبيرات الضارة. يعكس التحليل اللهجي أساليب متناسقة مع تشكيلة اللهجات العربية، مما يتيح تعزيز الفهم اللغوي وطرق التفاعل.

تؤكد النتائج أن التنقية يمكن أن يتم تحقيقها من خلال أسلوبين رئيسيين: الاستبدال اللغوي المعدل بشكل بسيط وإعادة الصياغة التي تحتفظ بالمعنى. وقد أظهر البحث إمكانية بناء موارد تنقية عربية على نطاق واسع من خلال دعم نماذج اللغة الكبيرة (LLMs) والتحقق البشري.

كما أُتيح للجمهور الوصول إلى هذه البيانات عبر الرابط: [https://github.com/ArabicNLP-UK/AraDetox]، مما يفتح الأفق أمام المزيد من الأبحاث حول تنقية النصوص العربية، وتوليد نصوص آمنة، ومعالجة اللغة الطبيعية بثلاث اللهجات العربية.