في عالم الذكاء الاصطناعي، لطالما كان تحسين أداء نماذج تحويل النص إلى صورة (Text-to-Image) من الأمور الأساسية التي يسعى إليها الباحثون والمطورون. وفي هذا السياق، تُعتبر تقنية "تكميل سياق السياسة على نموذج الانتشار" (D-OPCD) خطوة ثورية، حيث تعزز هذه التقنية من قدرة التصاميم على تقديم صور عالية الجودة بناءً على النصوص المحددة.

تقوم فكرة D-OPCD على دمج تجربة الوكيل (Agent) في عملية توليد الصورة، مما يمنحها القدرة على الاستفادة من الذاكرة، والمهارات، وتنظيم سير العمل، والتحقق من النتائج، والتكرار من أجل تحسين جودة الصور بشكل مستمر. ومع ذلك، كانت هذه التحسينات تقتصر على تشغيل الوكيل الكامل.

تعمل التقنية الجديدة على تحسين النموذج نفسه من خلال تقطير المعرفة من تجربة الوكيل إلى أوزان نموذج الانتشار، مما يسمح للنموذج بالاحتفاظ بجزء من الفوائد حتى عندما يتم تفعيل النموذج باستخدام الاستفسارات الأصلية فقط.

بفضل استخدام وكيل تحويل النص إلى صورة مزودًا بأداة تحسين المهارات التلقائية (Auto Skill Evolver)، تم إثبات أن D-OPCD يمكن أن يعزز القدرات بشكل ملحوظ، حيث ارتفع متوسط درجة توليد الصورة المباشرة من 60.52 إلى 65.09 عبر أربعة معايير مختلفة. ومع امتصاص هذه المعرفة في أوزان النموذج، يمكن للوكيل التخلي عن المهارات المشبعة واستئناف التطور. كما أظهر جولة ثانية من استخدام أداة تحسين المهارات على مولد الصور المحدث تحسينًا إضافيًا بواقع 1.83 نقطة، مما يشير إلى إمكانية تطور مستدام بين الوكيل والنموذج عبر التعاون المستمر.

باختصار، تعد هذه التقنية خطوة نحو أنظمة تحويل النص إلى الصورة التي تتطور وتتفاعل مع بعضها، مما يفتح آفاقًا جديدة للإبداع في مجال الذكاء الاصطناعي. ما رأيكم في هذه التطورات؟ شاركونا في التعليقات!