في عالم الرياضيات وعلوم الحاسوب، يمثل بناء الرسوم البيانية (Graph Construction) مهمة مهمة تتطلب إبداعاً ومهارة كبيرة؛ حيث تعتمد العديد من الأساليب المستخدمة على استكشاف شامل للرسوم البيانية ذات الصلة وعبقرية الإنسان. ومع تزايد استخدام الذكاء الاصطناعي التوليدي (Generative AI) في هذا المجال، يظهر التساؤل: هل يمكن لنماذج اللغات الكبيرة (Large Language Models) أن تبني رسومًا بيانية تمتاز بخصائص محددة باستخدام قدراتها المنطقية؟

للأسف، فإن العديد من مشكلات بناء الرسوم البيانية الطبيعية، مثل العثور على الرسوم البيانية ذات الجودة الرمزية القصوى (extremal Ramsey-good graphs) التي تتجنب أنواع معينة من الرسوم أحادية اللون (monochromatic subgraphs)، تم استكشافها بشكل مكثف في الأدبيات، مما يجعل من الصعب تحديد ما إذا كانت عملية البناء ناتجة عن قدرة النماذج على التفكير المنطقي أو مجرد استذكار من البيانات التي تم تدريبها عليها.

لذا، نقدم لكم مجموعة بيانات "RamseyGadgets"، التي تضم 70 مشكلة غير مستكشفة تتعلق ببناء الرسوم البيانية، حيث تتطلب إيجاد رسوم بيانية ذات جودة رمزية خاصة، مثل وجود حافة بلون ثابت. تتميز هذه المشكلات بحلول معقولة الحجم (أقصى حد 10 قمة)، مما يسمح بالتحقق من الإجابات باستخدام أدوات الحل المستقل (SAT solvers)، مما يجعلها مناسبة للتقييم التلقائي.

تم تصميم مجموعة بياناتنا لتكون سهلة التوسع؛ حيث يمكن ببساطة تغيير الرسوم الأحادية اللون التي يتم تجنبها للحصول على مجموعة جديدة من المشكلات. لقد قمنا بتقييم أداء خمسة نماذج مفتوحة المصدر من نماذج اللغات على مجموعتنا، وخلصنا إلى أن هذه النماذج حققت دقة بلغت 37.70% فقط على المشكلات ذات المستوى الصعب، حيث حقق نموذج Gemma-4-31B أفضل أداء بين الخمسة. كما أننا عرضنا كيف تساعد مجموعتنا في تحديد نوع التلميحات التي تساعد نماذج اللغات على الأداء بشكل أفضل في هذه المهمة.

فهل نحن على أعتاب فهم جديد لقدرات الذكاء الاصطناعي في مجال الرياضيات؟ تبقى الإجابة لدى المجتمع العلمي والراغبين في استكشاف المزيد. هل تعتقد أن تطوير مثل هذه المجموعات قد يحسن من أداء نماذج الذكاء الاصطناعي في مشاكل رياضية أخرى؟ شاركونا آراءكم في التعليقات!