في دراسة حديثة تم نشرها على منصة arXiv، تم تحديد وتأكيد تضارب أساسي يتعلق بنماذج تسلسل البيانات الطويلة. يشير البحث إلى أنه لا يمكن لأي نموذج أن يحقق في نفس الوقت ثلاثة متطلبات رئيسية: (1) كفاءة الحساب المستقل عن طول التسلسل، (2) حجم الحالة المستقل عن طول التسلسل، و(3) القدرة على استرجاع عدد من الحقائق التاريخية بالتناسب مع طول التسلسل.
تمت صياغة هذا التضارب ضمن مفهوم "معالج تسلسل على الإنترنت"، الذي يُوحد نماذج Transformers، ونماذج فضاء الحالة، والشبكات المتكررة الخطية، وهجيناتها. عبر الاعتماد على مبادئ عدم المساواة الخاصة بمعالجة البيانات وعدم المساواة لفانو، أثبت الباحثون أن أي نموذج يحقق الكفاءة والتناسب يمكنه استرجاع ما لا يزيد عن O(poly(d)/log V) من أزواج المفتاح والقيمة من تسلسل بأي طول، حيث يمثل (d) أبعاد النموذج و(V) حجم المفردات.
قام الباحثون بتصنيف 52 بنية معمارية منشورة قبل مارس 2026 ضمن هذا المثلث، موضحين أن كل واحدة منها تحقق ما لا يزيد عن اثنين من الخصائص الثلاث. كما أظهرت التجارب على مهام استرجاع المعلومات أن القدرة التجريبية على الاسترجاع تبقى دائماً تحت الحدود النظرية للمعلومات، مما يعني أنه لا يوجد هيكل معماري يمكنه الهروب من قيود هذا المثلث المستحيل.
مثلث المستحيل في نمذجة السياقات الطويلة: تحديات جديدة أمام الذكاء الاصطناعي
تظهر دراسة جديدة أن نماذج التسلسل الطويل تواجه تضارباً حاسماً بين الكفاءة، التناسب، والقدرة على الاسترجاع. هذه النتائج توضح أن لا نموذج يمكنه تحقيق جميع هذه الخصائص في وقت واحد.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
