في عالم البيانات الضخمة، يعد التكتل الطيفي (Spectral Co-Clustering) أداة فعالة لاكتشاف الهياكل الضمنية في مصفوفات الكلمات والمستندات. ومع ذلك، تعتمد الكثير من النماذج التقليدية على تحليل القيم الفردية (Singular Value Decomposition - SVD)، مما يجعلها مرتفعة التكلفة عندما نتعامل مع بيانات ذات أبعاد عالية.

وضعت دراسة جديدة استراتيجيتين عشوائيتين لتقريب التكتل الطيفي المُعَيَّر لمجموعات نصية ثنائية، حيث قد يختلف عدد مجموعات المستندات والكلمات.

تستند الطريقة الأولى إلى تحليل القيم الفردية العشوائية من خلال الإسقاط العشوائي، بينما تجمع الطريقة الثانية بين تحليل القيم الفردية الجزئي والمعاينة العشوائية.

عبر مجموعة من البيانات الحقيقية والمصطنعة، أظهرت الطريقتان تقليلاً في وقت التنفيذ بالمقارنة مع أسلوب تحليل القيم الفردية الكامل، لكن سلوكها كان يعتمد على تباين المصفوفات.

تعتبر طريقة الإسقاط العشوائي الأكثر موثوقية عبر الإعدادات المختبرة، في حين أن الطريقة القائمة على المعاينة كانت الأكثر فائدة على المصفوفات ذات الكثافة العالية، مما يوفر فوائد محدودة على البيانات النادرة. هذه النتائج تدل على أن الاختيار بين التقريبات العشوائية يجب أن يتم وفقًا للبنية الأساسية للبيانات، مما يعزز مرونة أساليب معالجة البيانات في البيئات ذات الحجم الكبير.