في عالم الذكاء الاصطناعي، تتقدم نماذج اللغة الكبيرة (LLM) بسرعة، لكن دراسة جديدة تسلط الضوء على مشكلة خطيرة تعاني منها هذه النماذج في سيناريوهات الإنتاج. حيث تُظهر النتائج أن هذه النماذج، رغم تحقيقها لنجاحات مرتفعة في الاختبارات القصيرة والمتوسطة، تفشل بشكل مروع عندما يتعلق الأمر بمهام طويلة ومتعددة الخطوات.

تتساءل هذه الدراسة عن سبب عدم استقرار هذه النماذج داخل بيئات الإنتاج، حيث يتمحور الأمر حول ما يُعرف بـ "أفق المهمة" (task horizon). فبينما تحققت نجاحات كبيرة في الاختبارات القصيرة، فإن الواقع يتطلب أداءً موثوقًا على مدى زمني أطول.

امتدت الدراسة عبر تسعة نماذج، من ضمنها ستة نماذج مفتوحة المصدر تتراوح من 1.2 مليار إلى 671 مليار وحدة من المتغيرات، وثلاثة أنظمة تجارية مُعتمدة. وقد شملت الدراسة تقييمات لعدة عائلات من المهام، مما أدى إلى نتائج مدهشة بشأن كيفية تأثير عدد الخطوات على مستوى النجاح.

تكشف النتائج أن النجاح في المهام يتبع قانونًا هندسيًا يخضع لمعدل موثوقية واحد لكل خطوة، والذي يرتفع مع زيادة حجم النموذج لكنه يتراجع بشكل حاد بعد عدد معين من الخطوات. حيث يظهر أن كل نموذج تم اختباره، حتى الأنظمة الأكثر استخدامًا، ينخفض نجاحه من أقصى درجات النجاح إلى مستويات قريبة من الصفر بمجرد تخطي الـ 16 خطوة.

وأكدت الدراسة أيضًا أن التدهور يرتبط بعدد الخطوات أكثر مما يرتبط بطول السياق، مما يشير إلى ضرورة إعادة النظر في استراتيجيات الاستخدام الحالية.

في نهاية المطاف، تقدم هذه النتائج دليلاً واضحًا على الحاجة إلى تقييمات مستندة إلى الأفق لضمان موثوقية نماذج الذكاء الاصطناعي في بيئات الإنتاج. فما هو برأيك الحل الأمثل لضمان الموثوقية في هذه الأنظمة؟ شاركونا آرائكم في التعليقات.