في عالم متسارع تكنولوجياً، حيث تلعب البيانات دورًا رئيسيًا في تعزيز السلامة، أجرى فريق من الباحثين دراسة تقييمية تطبيقية تهدف إلى فحص كيفية تعامل خمسة نماذج كبيرة من نماذج اللغة (Large Language Models) مع بيانات المخاطر الفيزيائية المستمدة من حساسات متعددة.

**تقييم شامل لبيانات المخاطر**
بموجب التجربة، تم اختبار 60 سيناريو عبر ثلاث فئات رئيسية تشمل التقييم المشترك للحساسات، التناسب في الاستجابة، وتفكيك الأنماط، من خلال 1,800 استدعاء API مع ضبط درجة الحرارة على 0.0.

**نتائج مثيرة للاهتمام**
كشفت النتائج أن جميع النماذج المعتمدة لم تنتج أي إشارة تحذيرية احترازية في السيناريوهات التي ارتفعت فيها البيانات من عدة حساسات تحت حدود الأمان الفردية، بينما سجلت دقة قريبة من الكمال في حالات انتهاك حدود حساسة واحدة.

النماذج الخمسة، والتي تشمل ChatGPT-4o، Gemini 2.5 Flash، DeepSeek، Kimi، وLlama 3.1 8B، سجلت نقاط تقييم قريبة من الصفر في فئات السيناريوهات المتعددة الحساسات (Q2: 0.000-0.208؛ Q3: 0.000-0.592)، فيما أظهرت أداء قويًا في السيناريوهات ذات الحساسات المفردة (فئة B Q1: 0.975-1.000).

**شكل البيانات**
على الرغم من أن التنسيق الجدولي المنظم لا يظهر ميزة متسقة على الأسلوب الأدبي البسيط، إلا أن ChatGPT-4o أظهر أداءً ملحوظًا تحت سياق النثر (p = 0.001). هذه النتائج تتجاوز حدود الأكاديميا ولها تأثيرات مباشرة على الممارسين الذين يقومون بنشر النماذج المختبرة في أنظمة مراقبة السلامة الجسدية.