في عالم أنظمة التوصية ذات النطاق الواسع، نواجه مشكلة bottleneck تُعرف بـ "جدار الذاكرة"، وذلك بسبب الجداول السميكة والكثيفة التي تتطلب مساحة تخزينية ضخمة. بينما تستخدم تقنيات الاسترجاع التوليدية رموزاً منفصلة كمعرفات، إلا أن السياقات عالية الأبعاد لا تزال تعتمد على تنسيقات كثيفة غير فعالة.

استلهامًا من أساليب ضغط البيانات في رؤية الكمبيوتر، نقدم مفهوم معرفات سيمانتيك مزدوجة الأغراض (Dual-purpose Semantic IDs) لتحقيق كفاءة في الإدخال والإخراج تعادل تلك التي تصل إليها نماذج اللغة الكبيرة (Large Language Models). هذه المنهجية تستفيد من التكميم الهرمي لتكثيف التضمينات المستمرة إلى معرفات سيمانتيك منفصلة، مما يؤدي إلى دوار يقوم بدورين متزامنين:

1. **هوية تعاونية**: نموذج تفاعل المستخدمين مع العناصر عبر جدول تضمين قابل للتعلم.
2. **إعادة بناء المحتوى**: استخدام فك ترميز سيمانتيك خفيف الوزن لتقدير التضمينات في الوقت الفعلي.

يتضمن هذا النهج الاستغناء عن التخزين الواسع للمتجهات بفضل عملية إعادة البناء حسب الطلب، مما يقلل من الحمل على النظام و footprint البيانات. لقد قمنا بإثبات فاعلية إطار العمل من خلال تقييمات غير متصلة بالإنترنت ونشر ناجح عبر الإنترنت في أنظمة التصنيف والاسترجاع على نطاق واسع في منصة كبيرة لمشاركة الفيديو، مما يظهر أن الرموز المنفصلة فعلاً هي كل ما تحتاجه لتحقيق كفاءة عالية غنية بالمحتوى في أنظمة التوصية.