شهدت الأبحاث العلمية عصرًا جديدًا بفضل تقنيات الذكاء الاصطناعي، حيث تُعتبر نماذج اللغات الضخمة (LLMs) من أبرز الأدوات المستخدمة في إجراء التجارب العلمية. لكن، هل يكفي أن تنتج هذه النماذج كود قابل للتنفيذ؟ بالطبع لا!

يجب على هذه النماذج تنفيذ الأساليب المرجعية بدقة، وتصميم تجارب تفحص ادعاءات الأبحاث، وتقديم أدلة تدعم تلك الادعاءات. ومع ذلك، كثيرًا ما تنتج هذه الأنظمة ما يُعرف بالهلاوس المنهجية، مثل تقليل مجموعات البيانات بشكل غير صحيح أو استبدال بعض المكونات غير الفعالة بوظائف بسيطة مثل lookup.

لهذا السبب، تم تقديم إطار ABE-Ralph، الذي يُعد بمثابة الضمانة لتدقيق التجارب العلمية المدعومة بـ LLM. يعتمد ABE-Ralph على هيكلة ادعاءات البحث والبروتوكولات والمكونات اللازمة والمعايير كقيود تجريبية مصنفة، مما يساعد في توجيه عملية التنفيذ عبر خطوات مدروسة.

أظهرت نتائج دراسات تجريبية واسعة النطاق، شملت 30 تجربة تتعلق بـ 12 مجالًا في تعلم الآلة، أن ABE-Ralph حقق معدل تنفيذ موثوق بنسبة 93% وتمكن من تحديد خمسة أنواع من الأخطاء العلمية. بل وتفوق أيضًا في الأداء على 5 مهام في تجربة NatureBench.

من الواضح أن التقييم الدقيق للمشاريع العلمية في مجال الذكاء الاصطناعي ينبغي أن ينظر بعناية هل التصميم التجريبي يختبر ادعاءات البحث بشكل دقيق، وأن الأدلة الناتجة تدعم هذه الادعاءات بدلًا من الاكتفاء بقياس تنفيذ الكود أو مؤشرات الأداء المعقولة.