في عالم الذكاء الاصطناعي، تتزايد أهمية نماذج اللغة الضخمة (Large Language Models) مع تزايد استخدامها في سيناريوهات المهام القليلة البيانات والتي تتغير باستمرار. ولذلك، أصبح التعلم من سياق عدد قليل من الأمثلة (Few-shot in-context learning) استراتيجية رئيسية للتكيف مع المهام المختلفة. ولكن، تعمل هذه الطريقة عادةً على استخدام مجموعة صغيرة من الأمثلة دون تجريد القواعد الخاصة بالمهام بشكل صريح، مما يجعلها حساسة للغاية لبناء الأمثلة.

على العكس من ذلك، يتمكن المتعلمون البشر من تقليل هذه الحساسية من خلال تلخيص القواعد من الأمثلة قبل تطبيقها على الحالات الجديدة. ومن أجل تقييم هذه القدرة، تم اقتراح معيار StrategyBench، والذي يختار مهام قابلة للاستدلال الاستراتيجي من مجموعة BIG-Bench، ويقوم ببناء استراتيجيات مرجعية، ويحدد مقاييس تقييم على بعدين: جودة الاستراتيجية وفائدة تنفيذها.

علاوة على ذلك، يتم تحليل استدلال الاستراتيجية من ثلاثة جوانب: تنوع المهام، وتكوين النموذج، وإعداد التكيف، مما يغطي الاختلافات بناءً على الفئات، واختيارات مولدات-منفذين، وتصميم العروض، والتكيف المستند إلى نماذج التعلم المدعومة. أظهرت التجارب أن فائدة الاستراتيجية الصريحة تختلف بشكل كبير عبر فئات المهام وتعتمد على ظروف توليد الاستراتيجيات وتنفيذها.

يمكن الاطلاع على المعيار الجديد من خلال الرابط: https://anonymous.4open.science/r/StrategyBench-D53C. يساعد هذا المعيار العلماء والباحثين على فهم أفضل لكيفية عمل نماذج اللغة الضخمة ويوفر آفاق جديدة في تطوير الذكاء الاصطناعي.