تشكل منصات التواصل الاجتماعي حجر الزاوية في تشكيل الحوار السياسي، ولكن مع تزايد حجم المحتوى الرقمي وتطوره السريع، يصبح التحليل المنظم لهذا المحتوى أمراً معقداً. في هذا السياق، نقدم إطار عمل شامل لتوليد تصنيف موضوعي قابل للتفسير من مجموعات نصية غير مصنفة. يستند هذا الإطار إلى دمج تقنيات تجميع البيانات المستندة إلى التضمين (embedding-based clustering) مع استنتاج نماذج اللغة الكبيرة (LLM) بشكل تكراري.

وهو يسمح بإنشاء تصنيف موضوعي بدون الحاجة إلى تسميات مسبقة أو مواضيع نموذجية. يبدأ العمل بتوليد مواضيع مرشحة من مجموعات الوثائق، ثم يستخدم التصنيف الناتج لتعيين تسميات موضوعية متسقة عبر المجموعات.

قمنا بتقييم هذه الطريقة من خلال دراسة حالة تتعلق بالدعاية السياسية قبيل الانتخابات الرئاسية الأمريكية لعام 2024. باستخدام التصنيف الناتج، تم دعم التحليلات التالية حول انتشار القضايا، وإطار الأخلاق، ونفقات الدعاية، وأنماط التعرض الديموغرافي.

تظهر هذه النتائج أن بناء التصنيفات بشكل تكراري يمكن أن يوفر نهجًا قابلاً للقياس والتفسير لتنظيم كميات ضخمة من النصوص غير المصنفة، بينما يدعم في الوقت نفسه تحليلًا موضوعيًا عميقًا.