تعتبر عملية توليد الفيديوهات جزءًا مركزيًا من إنشاء محتوى مدعوم بالذكاء الاصطناعي (AI). إن توافق الفيديوهات المولدة مع تفضيلات البشر يُعد معيارًا أساسيًا لتقييم جودة العملية. ورغم التقدم الملحوظ في جودة المرئيات، إلا أن هناك ثلاث تحديات رئيسية تواجه هذا المجال.

أولاً، يعتمد موثوقية إشارات المكافأة على جودة بيانات تفضيلات البشر، والتي غالبًا ما تتأثر بالضوضاء الذاتية والتحيزات. ثانيًا، تعمل نماذج المكافآت القياسية على اختزال تفضيلات البشر متعددة الأبعاد إلى قيمة واحدة، مما يؤدي إلى فقدان التوازن الديناميكي بين أبعاد التفضيل المختلفة. وأخيرًا، في عملية تحسين السياسات، يفرض الانحراف كيلينيان (KL divergence) قيودًا محلية بشكل أساسي وقد تفشل هذه الطريقة في التقاط البنية العالمية لتفضيلات البشر.

لمواجهة هذه التحديات، نقدم إطارًا موحدًا يعتمد على التعلم المدرك للتفضيلات لتوليد الفيديوهات. أولاً، نقوم بتقديم تصفية موجهة للنخبة (elite-guided filtering) لضبط بيانات التفضيلات وبناء إشراف موثوق لتدريب نموذج المكافأة. ثم نقوم بنمذجة جودة الفيديو كتوزيع مكافأة متعدد الأبعاد لالتقاط الغموض الموجود في تفضيلات البشر، ونعتمد على مسافة ويرشتاين (Wasserstein distance) لمواءمة توزيع المكافأة المكتسب مع توزيع التفضيلات البشرية الفعلي.

أخيرًا، نقوم بإدخال مواءمة توزيع ويرشتاين (Wasserstein-based distributional alignment) في نموذج تحسين السياسات. لقد أثبتت التجارب المتعلقة بنمذجة المكافآت وتوليد الفيديوهات أن منهجنا يحسن موثوقية إشارات المكافأة وتناسق التصور للفيديوهات المولدة. يمكنكم الاطلاع على كود المصدر الخاص بطريقتنا على GitHub.

ما رأيكم في هذه التقنية الجديدة؟ هل تعتقدون أنها ستحدث فرقًا في عالم صناعة المحتوى المدعوم بالذكاء الاصطناعي؟ شاركونا في التعليقات!