في دراسة جديدة نشرت في arXiv، يتم تناول تساؤلات جوهرية حول نماذج اللغات المتعلقة بالمواد (Materials LLMs) وبالأخص نموذج CARAT. عندما يطرح علينا سؤال حول بنية بلورة ما، هل يعتمد النموذج على التفكير والتحليل أم أنه يقوم بنسخ إجابة تم إدراجها مسبقاً؟ إن التحقق من دقة الإجابة غالباً ما يكون محيراً لأن الوصف البنيوي يمكن أن يتضمن نفس المعلومات التي يتم تقييمها.
نموذج CARAT يستخدم أسلوباً مبتكراً؛ إذ يحتفظ بنفس السؤال وإجابة مرجعية عبر ثمانية وجهات مختلفة، ويعرض العلاقات البنيوية بشكل منفصل في GraphSpace، مما يعزز من دقة التحليل. ومن خلال إضافة التعزيز الدقيق (fine-tuning) وتخفي الإجابات (answer masking) وحقن الأدلة (evidence injection)، يمكن للنموذج تحسين دقته بشكل ملحوظ.
نتائج الدراسة استثنائية، حيث يتميز العرض المدعوم (grounded view) بتحقيق زيادة تصل إلى 17.3 نقطة مقارنة بالمدخلات التقليدية. ومع ذلك، يظهر البحث جوانب لم تكن مسبقة في نموذج GraphSpace، حيث يتفوق بفارق 19.3 نقطة على الرسم البياني الدوري البسيط.
لم يتوقف التحليل عند هذا الحد، حيث تناول الباحثون فحص نموذجهم الخاص. توصلوا إلى أن قاعدة تتخطى الارتباط وتقرأ القائمة مباشرة، أجابت عن أربع من سبع عائلات صعبة، مما أدى إلى إعادة بناء النموذج لتحقيق نتائج دقيقة.
CARAT: هل تتسم نماذج المواد اللغوية بالتفكير أم الاستنساخ؟
تتناول دراسة جديدة بعنوان CARAT الفروق بين قدرة نماذج اللغات على معالجة المعلومات حول بنية البلورات بمفهوم الاستدلال أو النسخ. النتائج تكشف عن مدى تعقيد فحص صحة الإجابات المستندة إلى معلومات سابقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
