في عالم الذكاء الاصطناعي، يتزايد استخدام نماذج اللغات الضخمة (Large Language Models - LLMs) في تقييم الخصائص الجزيئية. ولكن، هل تعلم أن هناك تحدٍ حقيقي يتعلق بدقة هذه النماذج؟

تظهر الأبحاث الأخيرة أن القدرة على التنبؤ بخصائص جزيئية لا تعني بالضرورة أن النموذج يبتكر أو يتنبأ؛ بل قد يعتمد بشكل كبير على استرجاع القيم المنشورة. أجرى باحثون دراسة شاملة لـ 22 نموذجًا مختلفًا عبر 12 معيارًا لتقييم الأداء، ووجدوا أن استرجاع القيم بصورة حرفية (verbatim retrieval) منتشر بكثرة ولكنه يختلف من معيار لآخر.

حيث أظهرت النتائج أن أكثر من 50% من نماذج اللغات الضخمة استرجعت المعلومات بصورة حرفية في خمسة مجموعات بيانات، بينما كانت تظهر في خلايا معزولة فقط في المجموعات الأخرى. ولتعزيز فهم هذه الظاهرة، تم إجراء التجارب على مستويين مختلفين من التفكير؛ وقد تبين أن مستوى التفكير له تأثير مباشر على الاسترجاع، حيث كانت المحاولات للتنبؤ مع مستوى تفكير أعلى أكثر عرضة لتحديد قيم الاسترجاع.

تتضح هذه النتائج من خلال الاختبارات التي أظهرت أن نفس التجارب، عند تطبيقها على نفس الجزيئات ومع نفس المدخلات، يتم تصنيفها بنسبة 89% أكثر تكرارًا عند المستويات العليا من التفكير مقارنة بالمستويات الدنيا.

أخيرًا، تم اختبار طريقة جديدة لتعطيل استرجاع القيم في الحالات الأكثر تلوثًا، حيث تمكنت النماذج القوية من التعرف على تركيبات مختلفة من سلاسل SMILES وتحليلها. مما يدل على أن القدرة التنبؤية العامة لنموذج اللغة الضخم لا تعتمد فقط على العدد الإجمالي للقيم المحفوظة. هذه الدراسة تكشف النقاب عن تفاصيل دقيقة حول مدى عمق استرجاع القيم في التقييمات الجزيئية باستخدام النماذج اللغوية الضخمة.