في عالم الذكاء الاصطناعي، يبرز الابتكار الجديد GAM-Agent كإطار عمل يعتمد على نظرية الألعاب لتحسين عمليات التفكير البصري. بينما كانت النماذج السابقة تعتمد على وكيل واحد أو نماذج موحدة، يقدم GAM-Agent مقاربة مبتكرة تستند إلى لعبة غير صفرية بين عدة وكلاء—كل واحد منهم متخصص في مهام فرعية لفهم الرؤية. هذا النموذج لا يقتصر فقط على الفهم البصري، بل يتعاون مع وكيل مركزي يتحقق من منطق النتائج ويدقق صحتها.
تعتمد هذه الوكلاء على التواصل عبر إدعاءات منظمة، وأدلة، وتقديرات عدم اليقين، مما يعزز من دقة التحليلات ويزيد من تفسيرها. كما يقدم إطار العمل هذا وحدة تحكم واعية بعدم اليقين، التي تعمل على تكييف التعاون بين الوكلاء ديناميكياً، وتفعيل مناقشات متعددة الجولات عند اكتشاف عدم توافق أو غموض.
أثبتت التجارب على أربعة معايير صعبة—MMMU، MMBench، MVBench، وV*Bench—أن GAM-Agent يحسن الأداء بشكل ملحوظ عبر نماذج VLM المختلفة. وبشكل خاص، كان له تأثير إيجابي على النماذج الصغيرة إلى المتوسطة (مثل Qwen2.5-VL-7B وInternVL3-14B) حيث زاد من الدقة بنسبة تتراوح بين 5 إلى 6%. كما عزز الأداء في نماذج قوية مثل GPT-4o بنسبة تتراوح بين 2 إلى 3%.
تعد مقاربتنا مودولارية وقابلة للتوسع وقابلة للتعميم، مما يفتح الطريق نحو تطوير التفكير المتعدد الوكلاء بطريقة موثوقة وقابلة للتفسير.
GAM-Agent: ابتكار ثوري في التعاون بين الوكلاء لتحسين التفكير البصري
أطلقت دراسة جديدة إطار عمل GAM-Agent الذي يعتمد على نظرية الألعاب لتحسين عمليات التفكير البصري. هذا النموذج يقدم طريقة مبتكرة تعزز من دقة التوقعات وتزيد من تفسيرها.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
