تعتبر نماذج اللغة الكبيرة (Large Language Models - LLMs) واحدة من أبرز التطورات في مجال الذكاء الاصطناعي، حيث أظهرت أداءً قويًا في مجموعة متنوعة من مهام فهم الشفرة البرمجية. ومع ذلك، يبرز تساؤل مهم: هل تستطيع هذه النماذج التمييز بين التكافؤ الوظيفي (Functional Equivalence) عبر لغات برمجة مختلفة في الشفرات المكتوبة من قبل الإنسان؟
في محاولة للإجابة عن هذا السؤال، تم تطوير مجموعة بيانات جديدة تعرف باسم PolyHuman، التي تحتوي على برامج مكتوبة بلغة C++ وJava وPython. هذه الدراسة تسلط الضوء على أهمية التقييم في بيئة متعددة اللغات، حيث يتطلب الأمر عمقًا أكبر من مجرد مشابهة السطح.
استخدم الباحثون مجموعة البيانات لتقييم قدرة نماذج اللغة في كشف التكافؤ الوظيفي داخليًا وبين اللغات، حيث تم اختيار نموذج GPT-o4-mini كنموذج تمثيلي لدراسة الاستقرار. تمت دراسة 81 حالة من عدم الاتفاق بين النماذج في تقييم التكافؤ وجرى تحليل منطق الشفرة والتفكير المتسلسل المنتج.
أظهرت النتائج انخفاضًا اعتماديًا في الحكم على التكافؤ اعتمادًا على صعوبة المشكلة، بالإضافة إلى حساسية نموذجية معينة للغة البرمجة المستخدمة، خصوصًا في نموذج GPT-o4-mini. كما لوحظ أن هذا النموذج يظهر عدم استقرار ملحوظ في النتائج تحت ظروف مشابهة، مما يدل على وجود قدرة غير متسقة.
ختامًا، تشير النتائج إلى أن نماذج اللغة الحالية لا تستطيع بشكل موثوق التقاط مفهوم التكافؤ الوظيفي داخل أو عبر اللغات البرمجية، مما يفتح المجال لمزيد من البحث والتطوير في هذا المجال.
استكشاف مدى قدرة نماذج اللغة على تمييز التكافؤ الوظيفي عبر لغات البرمجة
تتجه نماذج اللغة الكبيرة (LLMs) نحو إثبات قدرتها على فهم الشفرات البرمجية، ولكن نتائج التقييم الحالية قد لا تعكس الفهم الحقيقي للمعاني. بحث جديد يستعرض إمكانية التحقق من التكافؤ الوظيفي عبر لغات برمجة مختلفة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
