في عالم العلم، لطالما لعب اكتشاف المعادلات العلمية دوراً مركزياً في التقدم العلمي، حيث يتم ذلك عبر دورات متكررة من إنشاء الفرضيات، واختبارها، وتحسينها وفقاً للقيود العلمية. ومع التقدم المذهل في قدرات نماذج اللغات الضخمة (Large Language Models) ودورها المتزايد في الذكاء الاصطناعي من أجل العلوم، يظل السؤال مفتوحاً: هل يمكن فعلاً لتلك النماذج اكتشاف قوانين علمية جديدة، وكيف يمكن تقييم هذه القدرة؟

لسد هذه الفجوة، تم تقديم معيار جديد يُدعى SCILAWS-BENCH، وهو معيار يهدف إلى تقييم اكتشاف القوانين العلمية من خلال البحث المنشور والبيانات العلمية الواقعية. يتألف هذا المعيار من 118 مشكلة مستمدة من 381 ورقة علمية، تغطي 291 قانوناً مرشحاً، وحوالي 8 ملايين نقطة بيانات حقيقية عبر ستة مجالات علمية.

يتم تقديم كل مشكلة في بيئتين تكميليتين: الأولى هي SCILAWS-REAL والتي تطلب من النماذج اقتراح قوانين من ملاحظات حقيقية ثابتة، وتقييم ملاءمة التنبؤ والصلاحية العلمية المشتقة من الأدبيات المصدرية. بينما في البيئة الأخرى، SCILAWS-PARALLEL، يتعين على النماذج الاستعلام عن عوالم مصفاة واسترداد قوانين خفية مُركبة مستمدة من الأشكال المنشورة.

يُظهر تصميم مهمة البيئتين الحفاظ على سياق كل مشكلة علمياً، مع تقييم منفصل لاكتشاف القوانين الساكنة واستعادة القوانين الخفية المُركبة. وتبين النتائج أن ملاءمة التنبؤ قد تختلف عن الصلاحية العلمية، وأن معرفة النماذج يمكن أن تؤثر في قدرتها على إعادة إنتاج أو الابتكار تخطياً للصيغ المنشورة التقليدية. إن هذا العمل يقدم معياراً مبنياً على الأوراق العلمية ورؤى تجريبية جديدة لتقييم الذكاء الاصطناعي في الاكتشاف العلمي.