في عالم الذكاء الاصطناعي، يعتبر وصف الصور بدون إشراف (Zero-shot Image Captioning - ZIC) تحديًا كبيرًا، حيث يتطلب وصفًا دقيقًا للصور دون الاعتماد على التوازي بين الصور والتعليقات أثناء التدريب. في عام 2024، توقفت العجلة التقدمية في هذا المجال، حتى ظهور تقنية جديدة تدعى Adjudicated Captioning.

تقوم هذه التقنية على إطار متعدد الوكالات مدعوم بتغذية راجعة بصرية عند عدة نقاط تفتيش، مما يعزز جودة النماذج دون الحاجة لإعادة تدريبها. تتضمن الخطوات الأساسية لهذه العملية:
1. **تركيب مشفر استرجاعي أقوى**: يعمل كأداة لتحسين جودة الاسترجاع من مجموعة البيانات.
2. **إدخال محقق تركيبي مجمد**: يُعيد ترتيب أفضل تسعة استرجاعات إلى خمسة فقط، مما يزيد من دقة الترجمة.
3. **إرفاق إعادة ترتيب متعلمة**: تُستخدم تقنيات متقدمة مثل TriFuse وMemAttend في هذه المرحلة، وهما مكونان مدربان بشكل ذاتي من خلال عملية التقطير عبر ثلاثة مقيمات مجمدة.

تظهر النتائج أن هذه التقنية حققت تحسينات ملحوظة على معايير التقييم مثل CIDEr وSPICE، حيث سجلت 117.6 و21.9 على التوالي على مجموعة بيانات COCO Karpathy.

تعتبر هذه الابتكارات بمثابة لمسة ثورية في مجال وصف الصور، حيث أنها قادرة على تحقيق مكاسب كبيرة في الأداء، مما يسهل التقدم في هذا الميدان الحيوي دون الحاجة إلى إعادة تدريب المعالجات.