في عالم البيانات الكبيرة، تمثل الرسوم البيانية النصية (Text-Attributed Graphs - TAGs) نموذجًا قويًا يجمع بين البنية الرسومية والمعاني النصية المعقدة. ومع ذلك، تواجه الطرق الحالية للتعلم التمثيلي على هذه الرسوم البيانية عوائق كبيرة في القابلية للتوسع، لا سيما عند دمجها مع نماذج اللغات الضخمة (Large Language Models - LLMs).

تعتبر تقنية تقطير البيانات (Data Distillation) حلاً واعدًا، ولكنها تكافح في التقاط العلاقة المعقدة بين الرسوم البيانية والنصوص وتعاني من ندرة تسميات البيانات في الإعدادات شبه المشرفة. ناهيك عن عجزها عن إنتاج سمات نصية يسهل قراءتها للبشر، وهو أمر ضروري للمهام المدعومة بـ LLM.

لمعالجة هذه التحديات، نقدم إطارًا موحدًا قائمًا على التعلم شبه المشرف، موجهًا بواسطة مسافة فاسرشتاين (Wasserstein Distance - WSD). بناءً على Findings التجريبية لدينا على TAGs الحقيقية، يقدم هذا الإطار وحدة ترميز تعاونية بين الرسوم والنصوص، تستخدم أجهزة تشفير ذات مسار مزدوج (graph-aware و -free) ضمن آلية تدريب ذاتي تعاونية. هذا يسمح باستخراج تسميات زائفة موثوقة ودمج ميزات الرسوم والنصوص.

علاوة على ذلك، طورنا خوارزمية رسم بياني قائمة على WSD ووحدة توليد نصوص LLM فعالة من حيث التكلفة، تستفيد من استخراج الكلمات الرئيسية المعتمد على المجموعات لتوليد ملخصات متناسقة وقابلة للقراءة البشرية للعقد المتكثفة. تجارب شاملة على مجموعات البيانات المعيارية أثبتت أن هذه التقنية تحقق توازنًا رائدًا في الأداء بين المهام المعتمدة على الشبكات العصبية الرسومية و LLM، مما يمكّن من تعلم وتحليل TAGs بفعالية وكفاءة.