في عالم الذكاء الاصطناعي، يُعتبر الفهم العميق لعملية التدريب أساسياً لتحقيق التقدم والابتكار. لكن هل تساءلتم يوماً: هل تتمتع نماذج اللغات الضخمة (LLMs) بنفس مستوى الفهم والحدس الذي يتمتع به أفضل الباحثين في هذا المجال؟ تكشف الأبحاث الحديثة التي قدمت معيار ArchitectureIQ عن المزيد من التفاصيل المثيرة في هذا السياق.

لقد أُجري اختبارات معيار ArchitectureIQ على نماذج لهدف قياس «حدس النموذج» بين نماذج الذكاء الاصطناعي والبشر. وتقريبًا كل سؤال يتضمن مجموعة بيانات مصطنعة وعدة وصفات تدريب، حيث يُطلب ممن يخضع للاختبار توقع الوصفة التي ستؤدي إلى أفضل نتيجة اختبار.

تشير النتائج العامة إلى أن حدس النماذج جيد، ولكنه بعيد عن الكمال حيث واجهت LLMs أربع قيود رئيسية:
1. **الحدس ليس مثاليًا**: بعض النماذج حققت دقة تقترب من 76% (مقابل 33% إذا تم الاختيار عشوائيًا)، بينما حقق أفضل باحث بشري دقة تصل إلى 66%، مما يدل على النقص في تحسينات تقنيات التقديم.
2. **الحدس تجريبي وليس هيكليًا**: البيانات تدعم أن زيادة حسابات Chain of Thought (CoT) لا تمثل تحسنًا كبيرًا. وبخلاف الرياضيات، لا يزال ينقصنا لغة «علم الذكاء الاصطناعي» التي تمكّن من الاستدلال الهيكلي في هذا المجال.
3. **الحدس ليس مضغوطًا بشكل مثالي**: يمكن أن يتم ضغطه أكثر في قاعدة معرفة، حيث جلبت قاعدة المعرفة التي أنشأناها وتحوي 20 عنصرًا مكاسب ملحوظة للنماذج الضعيفة.
4. **عدم حساسية الحدس لخصائص البيانات**: هذه النتيجة تشير إلى أن النموذج الأفضل يجب أن يعتمد في العموم على خصائص البيانات، مما يجعل البيانات هي «المادة المظلمة» الحقيقية في الذكاء الاصطناعي.

إن النتائج التي توصلنا إليها تثير تساؤلات حول فهمنا العام للبيانات وعلاقتها بالنماذج المعمارية. لا تزال هناك الكثير من المجهولات، لكن هذه الدراسات تقدم لنا فرصة لتطوير طرق فهم أعمق وأفضل.

ما رأيكم في هذه النتائج؟ هل تمثل هذه القيود مفاجأة لكم؟ شاركونا آرائكم في التعليقات!