مع تسارع التحول الرقمي في قطاع التصنيع، أو ما يعرف بالصناعة 4.0، أصبحت القدرة على تحقيق التوافق السلس بين الأصول المادية والبرمجية أمراً بالغ الأهمية. وتجسد أصداء إدارة الأصول (AAS) تمثيلاً رقمياً موحدًا لهذه الأصول، مما يجعلها حيوية لنماذج اللغة الكبيرة (Large Language Models) المستخدمة في توليد هذه الأصداء.
ومع تقدم نماذج اللغة الكبيرة، هناك تحديات تتعلق بالموثوقية والجودة، منها الأخطاء غير المتوقعة، وصعوبة وجود مرجع حقيقي موثق، وغياب مقاييس جودة محددة. لذا، فإن الهدف من هذا البحث هو تقييم مقاييس الجودة للأصداء التي تولدها هذه النماذج باستخدام إطار تقييم مستند إلى التغيير.
قمنا بتجميع بيانات من 200 منتج من عدة شركات، واستخدمنا نماذج مثل GPT-4o-mini وQwen3 وDeepSeek-R1 لتوليد 6400 نموذج من أصداء إدارة الأصول. أظهرت النتائج أن المقاييس المعتمدة على المطابقة الدقيقة لأسماء الخصائص والتشابه المبني على القيم كانت الأكثر موثوقية، خاصة قياسات الاسترجاع المبني على القيم والنقاط المقترنة بالأسماء (name-based F1 score).
كما قمنا بتحليل تأثير أنواع التغييرات المختلفة عبر نماذج وعائلات منتجات متعددة. تشكل هذه النتائج دعماً قيماً لاختيار المقاييس المناسبة، وضبط أنابيب نماذج الذكاء الاصطناعي، ودمج الأصداء المولدة بواسطة الذكاء الاصطناعي في التطبيقات الصناعية.
استكشاف مقاييس الجودة لنماذج لغة الذكاء الاصطناعي: كيف تتأكد من موثوقية النماذج الرقمية؟
تتعمق هذه المقالة في التحديات المرتبطة بالجودة في نماذج اللغة الكبيرة (LLMs) عند توليد أصداء رقمية للأصول. كما تقدم نهجًا مبتكرًا لتقييم المقاييس اللازمة لضمان الجودة في التطبيقات الصناعية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
