في عالم الذكاء الاصطناعي، يعد التواصل الفعّال مع نماذج اللغات الكبيرة (LLMs) أحد التحديات الرئيسية التي تواجه المطورين والمستخدمين على حد سواء. يبدأ الكثير من المستخدمين محادثاتهم بأسئلة بسيطة، ليبنون عليها استفسارات أكثر تعقيدًا في سياق محادثات متعددة الأدوار. وفي هذا الإطار، أصبحت تقنيات مثل الاسترجاع المعزز للتوليد (Retrieval-Augmented Generation - RAG) ونموذجها القائم على الرسوم البيانية (GraphRAG) من الأساليب البارزة لتجذير استجابات نماذج اللغات الكبيرة في أدلة خارجية.

ومع ذلك، تكشف دراسة جديدة نُشرت في arXiv عن مشكلة كبيرة: يُقيَّم أداء هذه الأنظمة عادة على استفسارات منفردة ومحددة، دون الأخذ في الاعتبار الفجوات في الأداء عند إجراء محادثات متعددة الأدوار. من خلال دراسة محاكاة شاملة، تم تحويل الأسئلة من معايير الإجابة متعددة الأدوار إلى محادثات غير محددة، وتم تقييم عشرة مساعدين من نماذج اللغات الكبيرة مع ثمانية أنظمة استرجاع عبر 1.5 مليون محادثة محاكاة.

النتائج قد تكون مقلقة، حيث كشفت الدراسة عن انخفاض كبير في الأداء قد يصل إلى 21% وزيادة في عدم موثوقية النظام تصل إلى 47%. وقد حدد الباحثون نمطين مميزين من الفشل وراء هذا التدهور: الأول هو "فقدان في الترجمة" حيث يؤدي إعادة صياغة المحادثة إلى تشويه استعلام الاسترجاع، والثاني هو "فقدان في المحادثة" حيث ينجح الاسترجاع ولكن نموذج اللغة يفشل في دمج الأدلة الموزعة عبر الأدوار.

هذه النتائج تدعو إلى إعادة التفكير في كيفية تقييم وكفاءة هذه النماذج خلال تفاعل المستخدم، مما يسلط الضوء على الحاجة إلى مزيد من الأبحاث لفهم وتحسين الأداء في سياقات المحادثات المعقدة.