تتواجه صناعة البرمجيات اليوم مع تحديات جسيمة فيما يتعلق بالتتبع (Traceability)، وهو عنصر أساسي لضمان موثوقية النظام وقابليته للصيانة والامتثال لمعايير الجودة. على الرغم من استخدام تقنيات استرجاع المعلومات (Information Retrieval) والتعلم الآلي (Machine Learning) غير المشروطة على نطاق واسع لاستعادة روابط التتبع تلقائيًا، إلا أن فعالية هذه التقنيات غالبًا ما تحددها جودة وبنية الوثائق المتاحة.

طبقت هذه الأساليب افتراضًا بأنها تحتوي على إشارات تتبعية ذات مغزى مُضمنة في البيانات النصية، وهو افتراض نادرًا ما يتحقق في البيئات الصناعية حيث تكون الوثائق Sparse وغير متناسقة أو غير متوازنة. علاوة على ذلك، يمكن أن تُظهر مقاييس التقييم التقليدية مثل الدقة (Precision) والاسترجاع (Recall) وضعف الأداء عند عدم أخذ خصائص البيانات في الاعتبار.

لذا، نقدم لكم تقنية TraceXplainer، وهو إطار عمل معلوماتي يهدف إلى تقييم موثوقية وحدود التتبع غير المشروط. يعتمد هذا النهج على استخدام المعلومات الذاتية (Self-information) والمعلومات المشتركة (Mutual Information) لقياس غزارة المعلومات والتوافق بين المصادر والوثائق.

من خلال تحليل شامل لمجموعات البيانات الصناعية، بينا أن عادةً ما تحتوي مجموعات التتبع النموذجية على اختلالات معلوماتية كبيرة، حيث تحتوي شفرة المصدر على معلومات أكثر مقارنةً بالوثائق المقابلة. علاوة على ذلك، تكشف مستويات المعلومات المشتركة والخسارة والضوضاء عن قيود داخلية على قدرة التقنيات غير المشروطة لاستعادة الروابط بدقة.

تظهر هذه النتائج أن تحسين التتبع في الممارسات الصناعية يتطلب توجهًا نحو الهندسة المعتمدة على البيانات، بحيث تركز على جودة الوثائق وتناسقها وتوافق المعلومات، بدلاً من مجرد تعزيز تعقيد النماذج. ستحصل هذه النتائج على رؤى مهمة للمتخصصين لمساعدتهم في تقييم جاهزية التتبع وإرشادهم في تحسين الوثائق وسير العمل التطويري.