تعتبر عملية توليد الفيديوهات جزءًا مركزيًا من إنشاء محتوى مدعوم بالذكاء الاصطناعي (AI). إن توافق الفيديوهات المولدة مع تفضيلات البشر يُعد معيارًا أساسيًا لتقييم جودة العملية. ورغم التقدم الملحوظ في جودة المرئيات، إلا أن هناك ثلاث تحديات رئيسية تواجه هذا المجال.
أولاً، يعتمد موثوقية إشارات المكافأة على جودة بيانات تفضيلات البشر، والتي غالبًا ما تتأثر بالضوضاء الذاتية والتحيزات. ثانيًا، تعمل نماذج المكافآت القياسية على اختزال تفضيلات البشر متعددة الأبعاد إلى قيمة واحدة، مما يؤدي إلى فقدان التوازن الديناميكي بين أبعاد التفضيل المختلفة. وأخيرًا، في عملية تحسين السياسات، يفرض الانحراف كيلينيان (KL divergence) قيودًا محلية بشكل أساسي وقد تفشل هذه الطريقة في التقاط البنية العالمية لتفضيلات البشر.
لمواجهة هذه التحديات، نقدم إطارًا موحدًا يعتمد على التعلم المدرك للتفضيلات لتوليد الفيديوهات. أولاً، نقوم بتقديم تصفية موجهة للنخبة (elite-guided filtering) لضبط بيانات التفضيلات وبناء إشراف موثوق لتدريب نموذج المكافأة. ثم نقوم بنمذجة جودة الفيديو كتوزيع مكافأة متعدد الأبعاد لالتقاط الغموض الموجود في تفضيلات البشر، ونعتمد على مسافة ويرشتاين (Wasserstein distance) لمواءمة توزيع المكافأة المكتسب مع توزيع التفضيلات البشرية الفعلي.
أخيرًا، نقوم بإدخال مواءمة توزيع ويرشتاين (Wasserstein-based distributional alignment) في نموذج تحسين السياسات. لقد أثبتت التجارب المتعلقة بنمذجة المكافآت وتوليد الفيديوهات أن منهجنا يحسن موثوقية إشارات المكافأة وتناسق التصور للفيديوهات المولدة. يمكنكم الاطلاع على كود المصدر الخاص بطريقتنا على GitHub.
ما رأيكم في هذه التقنية الجديدة؟ هل تعتقدون أنها ستحدث فرقًا في عالم صناعة المحتوى المدعوم بالذكاء الاصطناعي؟ شاركونا في التعليقات!
توافق الحواس البشرية: اكتشاف نظام مبتكر لتوليد الفيديوهات المدعومة بالذكاء الاصطناعي
نقدم لكم اكتشافًا جديدًا في مجال توليد الفيديوهات باستخدام الذكاء الاصطناعي، حيث نستعرض نظامًا مبتكرًا يتوافق مع تفضيلات البشر. هذه التقنية تعد بتجاوز التحديات الحالية في مجال جودة الفيديوهات المُنتَجة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
