في عالم الذكاء الاصطناعي، تعتبر البيانات العلمية ذات جودة عالية أساسية. لذا، فإن كل مجموعة بيانات تحتاج إلى أن تكون غير جاهزة من الناحية الحاسوبية فقط، بل أيضاً جاهزة من حيث الميتاداتا. وكما تم تقديمه في الأبحاث الأخيرة، تأتي أداة SetGo لتسليط الضوء على هذا الأمر الهام.
تعمل أداة SetGo على تقييم وتصحيح جاهزية الميتاداتا عبر ستة أبعاد قبل نشر أي مجموعة بيانات. هذه الأداة مفتوحة المصدر، مبنية بلغة بايثون (Python)، تهدف إلى معالجة المشكلات التي لم تتمكن الأدوات العامة من رصدها، مثل نقص التمويل والترخيص المتوافق مع المعايير.
على سبيل المثال، أظهرت التحليلات أن بيانات المناخ من ERA5 تحقق نسبة امتثال تبلغ 4% فقط وفق معيار ACDD 1.3. كما فشلت مجموعات بيانات المواد في تلبية متطلبات تعريف الأنواع من OPTIMADE. وبالإضافة إلى ذلك، تحتوي بيانات البروتيوم المستخلصة من PDB على شروط ترخيص غير متوافقة مع تعريفات SPDX القياسية.
بعد إجراء عملية تعزيز موجهة، تمكنت الأداة من رفع معدلات الامتثال لمبادئ FAIR (Fair, Accessible, Interoperable, and Reusable) من 52-57% إلى 81-91%. يسهل أمر النشر البسيط عبر SetGo البيانات لنشرها في منصات مثل Hugging Face Hub وCKAN وOpenMetadata مع ملحقات بيانات ML Commons Croissant 1.0.
ولإثراء تجربة المستخدمين، تدمج SetGo مع وكلاء الترميز الذين تدعمهم نماذج اللغات الكبيرة (Large Language Models) من خلال مهارة /setgo، مما يتيح تنفيذ حلقات التقييم، التعزيز، والنشر باستخدام اللغة الطبيعية مع الحد الأدنى من تدخل المستخدم، حيث يتطلب الأمر فقط تزويد القيم المفقودة من الميتاداتا.
SetGo: الأدوات الحديثة لضمان جاهزية البيانات العلمية للذكاء الاصطناعي
تكشف أداة SetGo عن أهمية جاهزية البيانات العلمية من حيث الميتاداتا لضمان استخدام فعال في الذكاء الاصطناعي. تقدم الأداة مفتوحة المصدر حلولاً لتقييم وتصحيح الميتاداتا، مما يعزز من جودة البيانات المتاحة للنشر.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
