عالم الذكاء الاصطناعي والروبوتات يتطور بسرعة، ومعه تتزايد أهمية البحث عن أفضل السياسات للتحكم في الروبوتات. في هذا الإطار، توصل فريق من الباحثين إلى نتيجة مثيرة للدهشة: إن الأداء العالي لسياسات التحكم المتعددة المهام يعتمد بصفة كبيرة على التمثيلات البصرية المستخدمة. في دراستهم التي نُشرت على arXiv، قدم الباحثون سياسة تمثيلية جديدة تسمى CoRP (Compressed Representation Policy)، والتي تتميز بكونها أكثر فعالية على الرغم من صغر حجمها.

تحتوي CoRP على 48.9 مليون معلمة، لكنها تعمل دون نموذج لغة بصرية أو سابقات توليد الفيديو، مما يجعلها نقطة انطلاق مثالية لفهم كيفية تأثير التمثيلات البصرية على الأداء. وقد توصل الفريق إلى أن التصميم المعماري للسياسة وتخزين المعلمات ليس الحاسم، بل أن التمثيل البصري هو العامل الأكثر أهمية.

لإثبات فرضيتهم، قام الباحثون بإجراء مجموعة من التجارب. على سبيل المثال، عندما أُجريت ابتدائية عشوائية باستخدام ViT-S/14، انخفض الأداء على LIBERO إلى 78.1%. كما أظهرت النتائج أن تقليل حجم البيانات الممثلة من خلال إعادة عينة كل عرض إلى 48 رمزًا كان له تأثير إيجابي كبير، متفوقة بذلك على الأداء باستخدام كافة الرموز.

هذه النتائج تشير إلى أن سياسات التحكم الفعالة يجب أن تكون مدربة مسبقًا ومعدلة وفقاً للمهام. تجربة CoRP تكشف عن كيف أن تمثيلات بصرية محددة يمكن أن تعزز الأداء، مما يفتح الأبواب لمزيد من الابتكارات في عالم الروبوتات.