في دراسة حديثة متخصصة، تم فحص كيف يمكن أن يساعد توسيع نطاق توليد الفيديو (Video Generation) النماذج في التفكير بشأن المعلومات المخفية المستخلصة من الإطارات السابقة، وما هي التكلفة الحاسوبية المترتبة على ذلك. تم استخدام معيار تحكم يتطلب التنبؤ بتسعة تحركات محددة مسبقًا لمكعب روبيك (Rubik's Cube) 2x2x2، من منظور ثابت لثلاثة وجوه. يؤدي النجاح في التنبؤ الصحيح إلى ضرورة استنتاج كيفية تغيير الأفعال للحالات المخفية، حيث يوفر المحاكي (Simulator) الحقيقة الأساسية الدقيقة للتقييم.

تعلمت النماذج الجيولوجيا المحتملة لمكعب روبيك في وقت مبكر، بينما تطلبت تكوينات الملصقات الصحيحة مزيدًا من التدريب بشكل ملحوظ. على الرغم من أن المتوسط التربيعي للخطأ (MSE) يتبع تقريبًا مقاييس القوة (Power-law scaling)، إلا أن انخفاض MSE لا يشير بشكل موثوق إلى قدرات التفكير النمطية. تتمكن النماذج الصغيرة النسبية من تحقيق دقة أعلى في الحالة باستخدام حوسبة محدودة، بينما تحقق النماذج الأكبر دقة أعلى بعد تدريب مكثف. مع حوالي 0.1 يوم من موارد الحوسبة (PF-days)، تمكن النموذج المكون من 70 مليون معلمة من التنبؤ بشكل صحيح بتكوين الملصقات المرئية في 44.6% من الإطارات التي تلت الأفعال، بالمقارنة مع 0.3% للنموذج الذي يحتوي على مليار معلمة، والذي حقق 83.7% بعد 3.14 يوم من موارد الحوسبة.

تشير الإشراف على الحالة الرمزية إلى رفع دقة الإطار للنموذج المكون من 20 مليون معلمة من 31.1% إلى 67.3% في ظل نفس ميزانية بيانات التدريب، مما يوضح أن تعلم تمثيلات تغييرات الحالة يمكن أن يكمل عملية التوسع. هذه النتائج تدعو العلماء إلى التفكير في كيفية تحسين استراتيجيات التدريب لتوفير المزيد من الكفاءة والموثوقية في النماذج المتقدمة.