تعمل نماذج اللغة الكبيرة (LLMs) بشكل متزايد من خلال مسارات طويلة تربط بين تعليمات المستخدم، واستخدام الأدوات، والملاحظات الخارجية، والذاكرة. في حين أن المعايير الحالية تركز بشكل رئيسي على تقييم النتائج السلوكية، فإنها تقدم دعماً محدوداً لتحليل التخصيص الدقيق. في هذه المقالة، نعلن عن مفهوم "تحليل تخصيص المسارات" (Trajectory Attribution) ونقدم إطار تقييم وتوثيق لهذا الغرض.
لقد تم تنظيم المعايير تحت مخطط موحد مكون من مكونات متنوعة، مع توفير توثيق العنصر الأساسي للتخصيص، بالإضافة إلى سلاسل الهجوم والتنفيذ حيثما كان ذلك قابلاً للتطبيق. من خلال تطبيق هذا الإطار على مسارات تم جمعها من AgentDojo وبيئات Stage وCanary من Agent3Sigma، تم الحصول على أكثر من 1300 مسار موثق يتضمن إجراءات متوافقة مع المهام، وإجراءات غير آمنة، ورفض الأمان.
يحدد الإطار تقييمين أساسيين: تحديد موقع التخصيص الأساسي واستعادة سلسلة التخصيص، ويوفر خطوط أساس مرجعية تعتمد على مساهمة المسار التدريجي وتغيير مكونات معينة. يجسد هذا الإطار إعدادات تخصيص متنوعة تتضمن تخصيصات محلية وطويلة المدى بالإضافة إلى سلاسل تخصيص منظمة.
تظهر نتائج خطوط الأساس المرجعية فروقات كبيرة في الأداء عبر هذه الإعدادات مما يوفر وصفاً أولياً لتحديات التخصيص في هذا الإطار. يتجاوز هذا الإطار الحد الأولي، حيث نطلق مهارة توثيق قابلة لإعادة الاستخدام تمكن من توحيد وتوثيق وتقييم المسارات الناتجة عن نماذج وكلاء جديدة تحت نفس الإطار. لمزيد من المعلومات والموارد المستقبلية، يمكن الاطلاع على مشروعنا على GitHub [https://github.com/chenjing-2024/agent-trajectory-attribution].
ابتكار جديد في تحليل مسارات الوكلاء: إطار موحد لتقييم دقيق وتوثيق شامل
تقديم إطار جديد لتحليل مسارات الوكلاء في نماذج اللغة الكبيرة (LLMs) يسهم في تعزيز دقة تقييم الآداء. اكتشافات مثيرة في تقييم المسارات تحدد تحديات التقييم وتتيح مزيد من الأبحاث المستقبلية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
