في عالم النماذج البصرية، يُعتبر التقييم الدقيق جوهريًا لفهم ديناميكيات النماذج المختلفة. هنا يأتي دور CaliBench، الذي يقدم نهجاً جديداً لتحديد مدى دقة نماذج الفيديو المعتمدة على الديناميكيات الاحتمالية.

بدلاً من الاعتماد على المعايير التقليدية التي قد لا تعكس الواقع بدقة، يقوم CaliBench بتقييم النتائج في فضاء قابل للتفسير بشكل مباشر، مثل مؤشرات الصناديق أو أوجه النرد، مما يوفر وسيلة دقيقة لقياس المسافة بين النتائج المكتسبة وتوزيع مرجعي معروف.

يتم تجميع بيانات النتائج في فضاءات مُعرفة مسبقًا، مثل أدوات غالتون أو ألوان الروليت الأوروبية المُنحرفة، مما يتيح اختبارات ضبط دقيقة. من خلال تفكيك الأداء إلى محورين رئيسيين: 'قابلية التقييم' و'ضبط العوامل'، يُمكن تحديد مدى دقة النماذج المعتمدة.

أظهرت نتائج الاختبارات على تسع مشاهد ونماذج متعددة (مثل WAN-2.7 وHappyHorse-1.0) أن معظم النماذج تعاني من حصول تحريفات كبيرة، حيث تركز الاحتمالات على نتائج معينة بدلًا من إعادة إنتاج المرجع بدقة. في بعض الحالات، مثل نموذج Veo 3.1، تسقط النتائج إلى نتيجة واحدة فقط، مما يثير تساؤلات حول دقة وعملية هذه النماذج.

قامت الدراسة بإطلاق بروتوكول جديد مع مقياس محدد (المتوسط المُعدل لتحويلات المتغيرات الكلية، mnTV) لتقييم النماذج الجديدة بناءً على النتائج السابقة. في وقتنا الحالي، يُعتبر هذا الجهد جهداً مهماً نحو تحسين التقييمات ودقة النماذج المستقبلية.