شهدت الآونة الأخيرة تقدمًا كبيرًا في نماذج التوليد البصرية (Visual Generative Models) مما أتاح إمكانية إنتاج صور ومقاطع فيديو عالية الجودة. لكن، يتمثل التحدي الأكبر في كيفية تقييم هذه النماذج، حيث يتطلب الأمر غالبًا معالجة مئات أو آلاف الصور أو الفيديوهات، مما يعتبر مكلفًا من الناحية الحاسوبية. كما أن طرق التقييم الحالية تعتمد على تنسيق ثابت يتجاهل احتياجات المستخدمين الخاصة، مقدمة نتائج عددية دون تفسير واضح.
لذلك، تم اقتراح إطار عمل جديد يسمى Evaluation Agent، والذي يتبنى استراتيجيات بشرية لتقديم تقييمات متعددة الجولات بشكل ديناميكي وفعال. بدايةً، يقوم الوكيل بتقسيم طلب التقييم بلغة طبيعية إلى جوانب فرعية، ثم يولّد طلبات مستهدفة، ويقوم باختيار صور أو فيديوهات من النموذج المقيّم، ويستخدم أدوات التقييم المناسبة، ويقوم بتحديث خطته بناءً على الأدلة الملاحظة، مما يغطي الأبعاد التقييمية المحددة مسبقًا واحتياجات المستخدم المفتوحة.
تظهر التجارب أن Evaluation Agent يقلل من وقت التقييم إلى 10% مقارنة بالطرق التقليدية، مع تقديم نتائج مشابهة. بالإضافة إلى ذلك، تم تقديم Open Evaluation Agent (Open-EA) من خلال بناء مجموعة بيانات EA-CoT-10K، والتي تحتوي على سجلات توجيه مفصلة تاريخيًا مشتقة من تقييمات متعددة الجولات. وتم تدريب EA-3B من Qwen2.5-3B-Instruct ليكون العمود الفقري للتخطيط المحلي، مما يحافظ على هيكل التفكير، واستدعاء الأدوات، وبروتوكول الملخص في الوكيل القائم على API، مع تقليل الاعتماد على الأعمدة الفقرية المملوكة.
في نهاية المطاف، تعطي التجارب التي تم إجراؤها على العوامل المرجعية القائمة على T2I/T2V والدروس المفتوحة التحقق من فعالية الوكيل القائم على API وتقييم Open-EA على عائلات مولدات T2V في أربعة مجالات داخلية وثلاثة خارجية، حيث أظهرت انتقالًا جزئيًا عبر العائلات في السياسة المتعلمة.
ثورة في تقييم نماذج التوليد البصرية: اكتشفوا Open Evaluation Agent!
تمكن الابتكار الجديد Open Evaluation Agent من تحسين عمليات تقييم نماذج التوليد البصرية بشكل كبير. باستخدام استراتيجيات شبيهة بالبشر، يسمح هذا الإطار بتقييم ديناميكي وفعال مع توفير تحليلات مخصصة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
