في عالم الذكاء الاصطناعي، يعد نظام استرجاع التعزيز (RAG) أحد الأنظمة الواعدة التي تعتمد على القدرة على تقديم إجابات صحيحة بدقة. ولكن ماذا يحدث عندما يتعرض هذا النظام لمواقف يعجز فيها عن تقديم معلومات دقيقة؟ دراستنا الجديدة تلقي الضوء على هذه القضية.

تسلط الأبحاث الحديثة الضوء على الخلل في نظام RAG فيما يتعلق بالتصنيف القائم على الحجم، حيث تمنح الأنظمة التي تقدم إجابات حتى وإن كانت غير صحيحة درجات أعلى من تلك التي تمتنع عن الإجابة عندما لا تكون المعرفة متوفرة. ويعزز ذلك الحاجة إلى إطار تقييم يحوي عقوبات واضحة للردود غير الصحيحة.

استنادًا إلى التحليل الجديد لكالي وآخرين في 2025، يتضمن الإطار تقييمًا قائمًا على العقوبات تتضمن:
1. **تسجيل غير متساوٍ** (صحيح +1، خاطئ -4، امتناع 0): حيث يتم احتساب درجات كافية لاجبار الأنظمة على التفكير مرتين قبل تقديم إجابة.
2. **إقرارات الفجوات المعرفية**: مثل الأسئلة التي تكون إجاباتها غير موجودة في قاعدة المعرفة، مما يجعل كل إجابة هنا تعتبر إنتاجًا غير مدعوم.
3. **خط أنابيب تفريق الفشل**: وهو عنصر حيوي يساعد على فهم الأسباب وراء الفشل في استرجاع المعلومات أو توليد البيانات.

طبقنا هذا الإطار على ثلاث أنظمة تجارية لـ RAG بالإضافة إلى نظام لا يعتمد على الاسترجاع، باستخدام قاعدة بيانات SimpleQA-Verified المكونة من 1000 سؤال. وكانت النتائج مثيرة للاهتمام؛ حيث يتراوح مستوى الدقة في الإجابة بين 97.0% و98.0% بين الأنظمة، لكن معدل انتهاكات إقرارات الفجوات المعرفية كانت متفاوتة بشكل كبير (من 16.7% إلى 98.1%).

تظهر هذه الدراسة بوضوح أن الأنظمة ليست مفصولة بما يمكنها الرد عليه فحسب، بل أيضًا فيما إذا كانت تمتنع عن الإجابة عندما يتوجب عليها ذلك. وبفضل التطبيق العملي لقواعد العقوبات، يمكن إعادة ترتيب الأداء حسب كمية الأخطاء المحدثة.

كل الشيفرات والتكوينات وصوت الحكام متاحة للتدقيق المستقل، مما يعكس جهود الشفافية في تحسين أنظمة الذكاء الاصطناعي. وقد تكون هذه الخطوات طريقًا نحو تحسين مستقبل الذكاء الاصطناعي ورفع دقة إجابات أنظمة RAG.