في السنوات الأخيرة، تطورت نماذج اللغة المرئية (Visual Language Models) بشكل كبير، خاصةً في قدرتها على فهم العلاقات المكانية بين الأجسام في الفضاء ثلاثي الأبعاد. ولكن، رغم هذه التقدمات، لا تزال هذه النماذج تعاني من ضعفٍ واضح عندما يتعلق الأمر بالتطورات الجديدة أو الأسئلة المعاد صياغتها، مما يؤدي إلى توقعات غير دقيقة أو متضاربة.
تقدم الدراسة الجديدة إطار عمل يعد بتجاوز هذه العقبات، يُعرف باسم TTL-SR (Test-Time Learning for Spatial Reasoning). يستغل هذا النظام قيوداً هندسية تعتمد على البيانات غير المعلّمة لإعادة توجيه النماذج لتناسب المجالات المستهدفة. من خلال دمج استفسارات مساعدة مرتبطة هندسياً، يمكن أن يُحسن النظام من دقة التوقعات.
أظهرت التجارب التي أجريت على مجموعة بيانات Q-Spatial-ScanNet نتائج واعدة، حيث حقق النظام ارتفاعاً في دقة الأداء بنسبة 6.47% و9.41% على نماذج Qwen3-VL-4B-Instruct وSpatialRGPT-VILA-1.5-8B على التوالي.
يُبرز هذا العمل أهمية التفكير الدقيق والحساس للهندسة في تطوير نماذج الذكاء الاصطناعي، ما يفتح الأفق أمام إمكانيات جديدة في هذا المجال المثير.
إعادة تصور الذكاء الاصطناعي: ف framework جديد لتحسين التفكير المكاني في نماذج اللغة
تقدم دراسة جديدة نظاماً مبتكراً يُعرف بـ TTL-SR لتحسين التفكير المكاني الكمي في نماذج اللغة المرئية. يعتمد النظام على قيود هندسية لتوجيه التعلم في الوقت الفعلي، مما يعزز دقة النماذج بنسبة ملحوظة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
