في عالم الذكاء الاصطناعي، تعتبر نماذج اللغة البصرية (Vision-Language Models - VLMs) أحد أهم الأدوات المستخدمة في تمكين الوكلاء الذكيين من فهم وتحليل المعلومات البصرية. ومع ذلك، فإن هناك تحديّاً أساسياً يتعلق بقدرتهم على دمج التفاصيل البصرية الدقيقة في اتخاذ قرارات مستندة إلى المهام. وفي محاولة لحل هذه الإشكالية، تم اقتراح إطار عمل جديد يُعرف باسم SpatialCLI.

يعمل SpatialCLI على تدريب نماذج اللغة البصرية على التفكير باستخدام أدوات مكانية، مما يمكّنها من الاستفادة من القدرات البصرية المتخصصة التي يمكن أن تعزز أداءها. يتكون هذا الإطار من ثلاث مراحل رئيسية:
1. **الاستفادة من الأدوات المتخصصة**: حيث يتم استخدام نماذج الرؤية المتخصصة كأدوات مكانية لدعم إدراك نموذج اللغة البصرية.
2. **تحسين استخدام الأدوات**: من خلال استخدام تقنيات مثل عملية التعلم الباردة (Cold-Start) والتعلم المعزز (Reinforcement Learning)، مما يؤدي إلى تحسينabilities.
3. **التعزيز الداخلي**: حيث يتم verbalizing مسارات استخدام الأدوات الناجحة لتطوير القدرات البصرية المتخصصة بداخل النموذج.

بالإضافة إلى ذلك، تم تقديم SpatialCLI-Bench كمؤشر جديد يتضمن 516 مثالاً لتقييم الإدراك المركب عبر معايرة الموقع، والتجزئة، والعمق، ووضع الجسم.

تشير النتائج إلى أن SpatialCLI قد رفع أداء نموذج Qwen3-VL-8B-Instruct على منصة MindCube من 29.3% إلى 84.6% باستخدام الأدوات، متجاوزاً أداء GPT-5.6 Sol بحصوله على 72.1%، مع الاحتفاظ بأداء 73.8% دون استخدام الأدوات بعد عملية التعزيز الداخلي.

إذا كنت مهتماً بعالم الذكاء الاصطناعي وتحسين تقنيات الإدراك البصري، فإن SpatialCLI يمثل خطوة هامة نحو مستقبل أفضل.
ما رأيكم في هذا التطور؟ شاركونا في التعليقات.