في عصر يشهد تحولًا جذريًا في تقنيات البرمجة، أصبحت نماذج اللغات الكبيرة (Large Language Models) والأجهزة الذكية أدوات أساسية في عملية تطوير الأكواد. لكن هل سمعتم عن القيود التي تواجه استخدامها عند التعامل مع البيانات الشخصية؟ تقيد المتطلبات الحكومية استخدام نماذج مستندة إلى السحاب نظرًا لخطر انتقال البيانات إلى خدمات خارجية، وهذا ما دفع إلى البحث عن بدائل.

تُقدم اليوم نماذج مفتوحة الوزن (Open-weight Models) حلاً لمواجهة هذه التحديات. حيث تم تطوير إطار عمل مفتوح المصدر يقيم فعالية هذه النماذج في معالجة واحدة من أكبر العقبات في الأبحاث المتعلقة بالدراسات السكانية الطويلة الأجل: إعداد البيانات.

يشمل هذا الإطار مجموعة مُعدة بعناية من بيانات الحقيقة الأرضية (Ground-truth Dataset) تتضمن نصوص تنظيف تقوم بإعداد ست جولات من البيانات من دراسة بريطانية، بالإضافة إلى تعريفات للمهام تشمل مهام مثل تنظيم الفئات والدمج متعدد الموجات. كما يتضمن الإطار روتينات آلية لتقييم الأكواد التي تنتجها نماذج اللغات الكبيرة وبياناتها الناتجة.

لقد تم اختبار هذه النماذج عبر مجموعة من أدوات النشر ذات الجودة الاستهلاكية، بقدر فعالية الوصول إلى إكمال المهام بنسبة تصل إلى 87.9%. وتظهر نتائج النماذج مفتوحة الوزن التي تعمل على الأجهزة ذات الجودة الاستهلاكية وعدًا حقيقياً نحو إعداد بيانات مدعوم بالذكاء الاصطناعي في بيئات البحث المحكومة.

إذا أردتم المزيد من التفاصيل حول هذا الإطار الثوري، يمكنكم زيارة GitHub. ما رأيكم في هذا التطور المذهل؟ شاركونا في التعليقات.