في عالم الذكاء الاصطناعي المتطور، يظل مفهوم النسيان في نماذج اللغة الكبيرة (LLMs) مسألة حيوية. فما هو K-Bench؟ هو معيار جديد مصمم خصيصًا لتقييم مستوى نسيان النماذج في التطبيقات العملية، مبرزًا الفجوة بين النظريات التجريبية والواقع العملي.
تُظهر المعايير التقليدية مثل TOFU وMUSE ثقلًا في تقييم مستويات نسيان النماذج، حيث تعتمد على ردود الأفعال النهائية للنموذج. ولكن مع K-Bench، نغوص في أعماق آلية عمل الوكلاء (agents) وكيفية تأثير التفاعل بين مختلف القنوات على عملية نسيان المعلومات.
K-Bench تقوم بفحص ست قنوات تعرضها وكيل ReAct، والتي تشمل التسلسل الزمني للأفكار (Chain-of-Thought) واستدعاءات الأدوات، مما يمنح الباحثين رؤية شاملة حول كيفية تسرب المعلومات السرية. كل تجربة ضمن K-Bench تتطلب وضع السر في مصدر واحد من ثلاثة مصادر متاحة (الأوزان، الطلبات، أو مخزن الاسترجاع). يتم حساب K-Score بشكل منفصل لكل مصدر ويمنح الفائدة فقط عندما يبقى الوكيل قابلاً للاستخدام.
المفاجأة الأكبر تكمن في أن عزل قناة الإجابات لا يجعل السر غير قابل للاستخراج. على سبيل المثال، في الأنظمة الهيكلية للاسترجاع، يبقى السر كما هو في قناة المراقبة، مما يدل على أن معدل التسرب يبقى ثابتًا. وعندما يوجد السر في الطلب أو مخزن الاسترجاع، لا تسجل المعايير التقليدية أي تسرب، بينما الوكيل المُطبق لا يزال يقوم بتسريب المعلومات في 22 إلى 86 بالمئة من الاستفسارات.
عندما يتواجد السر في الأوزان، لا تُظهر أية طرق من العشرين طريقة التي تم تقييمها قدرة على إزالته، ويحصل نسيان انتقائي فقط من خلال تدخلات تضر بالأدخل. تُظهر K-Bench تفوقًا على الطرق التقليدية وتعتمد على أساليب جديدة تفتح آفاقًا جديدة في مجال الذكاء الاصطناعي.
ما رأيكم في هذا التطور؟ شاركونا أفكاركم وتجاربكم في التعليقات.
K-Bench: معيار جديد لتقييم نسيان نماذج الذكاء الاصطناعي في تطبيقات الوكلاء
تقدم K-Bench معيارًا مبتكرًا لتقييم قدرة نماذج اللغة الكبيرة (LLMs) على نسيان المعلومات في سياقات التطبيق العملي. يكشف هذا المعيار عن كيفية تأثير تصميم الوكلاء على فعالية عمليات النسيان.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
