في عالم تكنولوجيا الذكاء الاصطناعي، تلعب نماذج اللغات الكبيرة (Large Language Models) دورًا حاسمًا في تعزيز دقة المعلومات. واحدة من التقنيات الحديثة التي تساعد في ذلك هي تقنية زيادة الاسترجاع (Retrieval-augmented Generation أو RAG)، التي تعتمد على استناد نماذج الذكاء الاصطناعي إلى أدلة مسترجعة لتحسين دقة الاستجابات المقدمة.

ومع ذلك، واجهت الأطر الحالية لتقييم أداء هذه التكنولوجيا تحديات عديدة في توفير تشخيص موحد ودقيق عبر طيف متنوع من الاستعلامات. فمن الاستقصاءات المحددة التي تبحث عن حقائق دقيقة، إلى الطلبات المفتوحة التي تتطلب تفسيرات موسعة، كان من الضروري تطوير طريقة تقييم جديدة.

نقدم لكم إطار Q-CARE، والذي يعد نظامًا تقييمًا مستقلًا عن الاستعلام، حيث يتيح تحليلًا دقيقًا عبر تجزئة الاستعلامات إلى استعلامات فرعية وتحليل الإجابات إلى مطالبات فردية. يعتمد Q-CARE على مبدأ تقييم موحد يقوم على تغطية الاستعلام وموثوقية المطالبات.

من خلال تطوير مقاييس جديدة مثل مقاييس استرداد المعلومات المراعية للتغطية (C-Prec@k، C-nDCG@k) ومقاييس تقييم الجيل على مستوى المطالبات (التكامل، الإيجاز، والموثوقية)، حقق Q-CARE نتائج متفوقة في الاختبارات، حيث أظهر ارتباطًا أعلى مع حكم البشر مقارنة بأربعة مقاييس حالية لتقييم RAG، بما في ذلك RAGEval وRAGChecker.

كذلك، تم إتاحة الكود والبيانات الخاصة بإطار Q-CARE عَبر الرابط التالي: https://github.com/DISL-Lab/Q-CaRE-COLM-26.

إن هذا التقدم يمثل نقطة تحوّل في تحسين مهارات الذكاء الاصطناعي المتعلق بالاسترجاع، ويعزز من موثوقية وكفاءة الأنظمة المستخدمة في معالجة المعلومات واستنتاج المعرفة. ما رأيكم في هذا الابتكار؟ شاركونا في التعليقات!