في عالم اليوم، أصبحنا نشهد تقدمًا مذهلاً في الأنظمة الذكية المعتمدة على نماذج اللغات الضخمة (LLM)، والتي أثبتت قدرتها على التعامل مع مجالات معقدة. ومع ذلك، فإن هذه الأنظمة غالبًا ما تواجه تحديات تتعلق بالأخطاء المتكررة وصعوبة تصحيحها. وإذا كنت تتساءل كيف يمكن تحسين هذا الوضع، فإن تقنيتنا الجديدة المسماة "TrajDebug" تقدم لك الحل.

تعتمد تقنية TrajDebug على إطار عمل متطور لتتبع أخطاء دورة الحياة، والذي يركز على اكتشاف الأخطاء في المسارات الطويلة عن طريق ضغط التاريخ بمستويات متعددة وتحديد الأخطاء بشكل موثوق. الهدف الرئيسي هو تحديد الخطوة الأولى التي أدت إلى الفشل النهائي، وهو أمر يبدو صعبًا نظرًا لطول المسارات، حيث يتم نشر الأدلة حول الأخطاء عبر تفاعلات وسياقات قد تكون بعيدة.

لكن التحدي لا يتوقف هنا؛ حيث أن المسارات الفاشلة غالبًا ما تحتوي على عدة أخطاء محلية تؤثر بشكل مختلف، فقط بعض هذه الأخطاء هو المسؤول عن الفشل النهائي. في هذا السياق، يقدم TrajDebug آليات لتتبع كل حالة من حالات الأخطاء الذي يسهم في التعرف على وضعياتها وتأثيرها.

وتمثل تجربة هذا النظام أكثر من مجرد معالجة الأخطاء؛ إذ تم إنشاء TrajErrBench، وهو معيار يضم 486 مسارًا فاشلًا تم تأشيرها يدويًا من Tau2Bench وSWE-Bench Pro، مما يغطي سيناريوهات استخدام الأدوات والترميز الواقعية.

أظهرت التجارب على مجموعة متنوعة من المعايير أنه بفضل TrajDebug، تم تحقيق أداء متفوق مقارنة بالأسس الحالية، مما يوفر تغذية راجعة قابلة للتنفيذ لتحسين نجاح الوكلاء في المستقبل. ومن المقرر أن يتم إصدار الأكواد والبيانات لتمكين المزيد من الأبحاث في هذا المجال.

تأمل في هذه التطورات المثيرة في عالم الذكاء الاصطناعي! هل تعتقد أن هذه التقنية ستحدث ثورة في كيفية تعاملنا مع الأخطاء البرمجية؟ شاركونا آراءكم في التعليقات.