في العصر الحديث، حيث تلعب أنظمة الوكلاء المعتمدة على نماذج لغوية ضخمة (LLM) دوراً بارزاً في تطوير البرمجيات، بات من الضروري تسليط الضوء على كيفية عمل هذه الأنظمة وكيفية ضمان جودتها وموثوقيتها. بينت دراسة جديدة بعنوان "Arbiter: Detecting Interference in LLM Agent System Prompts" كيفية استخدام إطار العمل Arbiter لاكتشاف التداخل في الموجهات الخاصة بهذه الأنظمة.
تعود أهمية هذا الإطار إلى كونه يمزج بين قواعد التقييم الرسمية واستخدام نماذج لغوية متعددة (multi-model LLM) للكشف عن أنماط التداخل في الموجهات. فقد تم تطبيقه على ثلاثة موجهات رئيسية لوكلاء البرمجة: Claude Code (Anthropic)، Codex CLI (OpenAI)، وGemini CLI (Google).
تم الكشف عن 152 نتيجة خلال المرحلة الأولية للكشف و21 نمط تداخل تم تصنيفه يدوياً خلال التحليل الموجه لأحد البائعين. كما أظهرت النتائج أن بنية الموجهات (monolithic, flat, modular) ترتبط ارتباطاً قوياً بفئة الفشل الملاحظة، على الرغم من عدم ارتباطها بشدة الفشل.
من المثير للدهشة أن التحليل بواسطة النماذج المتعددة أظهر اكتشاف فئات مختلفة من الثغرات مقارنة بالتحليل بنموذج واحد. وأحد الاكتشافات المثيرة كان فقدان البيانات الهيكلية في نظام ذاكرة Gemini CLI، والذي تناسب مع مشكلة تم الإبلاغ عنها وإصلاحها من قبل Google، حيث تم معالجة الأعراض دون معالجة السبب الجذري على مستوى المخطط.
في المجمل، تمثل تكلفة التحليل عبر الموردين مبلغاً ضئيلاً لا يتجاوز 0.27 دولار أمريكي. يمثل إطار العمل Arbiter خطوة مهمة نحو تحسين جودة وأمان البرمجيات المعتمدة على الذكاء الاصطناعي، ويقدم لنا مفاتيح لفهم كيفية تحسين الأنظمة الحالية.
اكتشاف التداخل في أنظمة الوكلاء المعتمدة على نماذج لغوية ضخمة: إطار العمل Arbiter
تقدم دراسة جديدة إطار عمل Arbiter للكشف عن التداخل في الموجهات الخاصة بالوكلاء البرمجيين المعتمدين على نماذج لغوية ضخمة. يسلط البحث الضوء على نتائج مهمة تسهم في تطوير برمجيات أكثر كفاءة وأماناً.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
