في عالم الذكاء الاصطناعي وتطبيقات نماذج اللغات الضخمة (LLMs)، يتوقع المستخدمون أداءً موثوقًا وعالي الجودة. ومع ذلك، تشير دراسة جديدة إلى وجود فجوة كبيرة في موثوقية هذه النماذج عند مواجهة ظروف عمل غير مثالية. تحت عنوان **EnterpriseRAG**، تم تناول التحديات التي تواجهها نماذج الذكاء الاصطناعي في مواءمة الاستجابة مع متطلبات العمل المعقدة.

تُظهر الدراسة أن نماذج الذكاء الاصطناعي تحقق نسبة رضا تصل إلى 80% عن المتطلبات الفردية، لكن عند النظر إلى الاستجابة الشاملة، تتقلص هذه النسبة إلى 26.8% فقط. هذا يكشف عن فجوة شديدة تصل إلى 57 نقطة بين ما يُحقق على مستوى الأوامر الفردية وآلية التنسيق المطلوبة لتلبية المتطلبات المتعددة في بيئة العمل.

تستند الدراسة إلى تحويل 983 نموذجاً تم التحقق من صحته من قبل خبراء عبر ستة مجالات، حيث تم تصميم ظروف اختبار تحاكي التحديات الحقيقية التي تشمل الضوضاء في الاسترجاع، وفجوات المعرفة، وصراعات الحقائق. وقد قُيمت 13 نموذجاً حديثاً من النماذج، حيث أظهرت النتائج سقوطًا كبيرًا في الالتزام بالتعليمات، رغم أن التقييم الفردي للمتطلبات كان يبدو إيجابيًا.

تشير النتائج إلى ضرورة وجود بروتوكولات واعية للسياق وتقدير محسوب عند استخدام نماذج RAG في العمل. يقدم **EnterpriseRAG** أساسًا يمكن تكراره لقياس وتقليل هذه الفجوات، مما يؤثر بشكل مباشر على قرارات الإطلاق لنظم RAG ذات النطاق الكبير. وسيتم نشر إطار العمل وبيانات القياس قريبًا.

ما هو رأيكم حول هذه الدراسة؟ وهل تتفقون مع النتائج التي تم الوصول إليها؟ شاركونا أفكاركم في التعليقات.