أصبحت نماذج اللغة الكبيرة (Large Language Models) مدعومة بالأدوات، تمثل جيلًا جديدًا من الوكلاء المستقلين القادرين على استخدام محركات البحث والواجهات البرمجية (APIs) لحل مهام معقدة وطويلة المدى. ولكن، ورغم هذه التطورات، لا تزال هناك تحديات رئيسية غير مستكشَفة في المجال، مثل فهم نوايا المستخدمين الواقعية، وتخطيط واجهات البرمجة المعقدة متعددة الخطوات.
لكسر هذه الحواجز، تم إطلاق معيار AISE-Bench، وهو معيار شامل ومعلق يهدف إلى تحسين استكشاف المعلومات على الرسوم البيانية المعرفية الأكاديمية. AISE-Bench يتضمن 1,133 مجموعة من أسئلة وأجوبة، بالإضافة إلى تصنيفات الاستفسارات، ومسارات تنفيذ API كاملة، ومعلمات موثقة، وإجابات قائمة على المصادر مع روابط مرجعية.
هذا المعيار ليس مجرد مجموعة من البيانات، بل يشمل أيضًا بروتوكول تقييم شامل يقيس جودة الإجابات، ودقة التخطيط، ونجاح التنفيذ. من خلال تجربة 14 طريقة تكنولوجية، يُظهر البحث أن النموذج الأقوى، وهو PLAY2PROMPT مع Gemini-3-Pro، قد حقق فقط أداءً متوسطًا، وغالبًا ما واجه صعوبات في التخطيط والتنفيذ.
AISE-Bench لا يمثل مجرد تقدم في تقييم نماذج الذكاء الاصطناعي، بل هو تحدٍ جديد يدعو الباحثين والمطورين لتحسين دقة الخطوات، وتقنيات التسوية المستندة، واستنتاجات موثوقة لوكلاء نماذج اللغة الكبيرة التي تستخدم واجهات برمجة التطبيقات. المزيد من التفاصيل والبيانات متاحة على AISE-Bench موقع.
AISE-Bench: معيار ثوري لتحسين أدوات الذكاء الاصطناعي في استكشاف المعلومات الأكاديمية!
تم إطلاق AISE-Bench، معيار جديد يهدف إلى تعزيز أداء نماذج الذكاء الاصطناعي في استكشاف المعلومات الأكاديمية بشكل شامل. يتضمن هذا المعيار أكثر من 1000 مجموعة أسئلة وأجوبة تعزز الفهم العملي للقدرات الحالية وأوجه القصور.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
