في عالم الذكاء الاصطناعي، تكمن قوة نماذج اللغات الكبيرة (LLMs) في قدرتها على التفكير منطقياً عبر ما يسمى بـ "سلسلة الأفكار" (Chain-of-Thought). لكن هل تساءلت يومًا كيف يمكن لهذه الآلية أن تكشف عن الأخطاء الفكرية بدلاً من مجرد تقييم صحة كل خطوة على حدة؟

أصدرت دراسة حديثة على موقع arXiv تسليط الضوء على هذه القضية. بينما كانت الأساليب الحالية تركز بشكل رئيسي على تقييم صحة المعاني أو اتساق كل خطوة من سلسلة الأفكار، فإن معظمها لم تأخذ بعين الاعتبار كيف تتطور عملية التفكير عبر المسار الكامل. هذا يقودنا إلى فجوة كبيرة في البحث حول كيفية الكشف عن الإخفاقات التي قد تتوزع عبر مسار التفكير وليس فقط تلك المتوقفة عند خطوة واحدة.

وأظهرت الدراسة أن ديناميات سلسلة الأفكار يمكن أن تُستخدم بشكل فعال لتفريق بين عمليتي التفكير الناجحة والفاشلة، وذلك بدون الحاجة للاعتماد على معايير المعاني. من خلال مراقبة مجموعة متنوعة من مهام القضايا المنطقية، تمكن الباحثون من تقديم مقارنة محددة بالقرب من حدود قدرات كل نموذج.

النتائج كشفت عن أن النماذج كانت لديها ميول للانتقال المبكر نحو استنتاجات خاطئة، تفقد النجاح في سياقات متنوعة، ما يؤدي إلى نتائج غير مرضية. بل وتبين أنه يمكن تحسين دقة نموذج Llama3-70B من 13.3% إلى 85% من خلال تدخل مستهدف في عملية البحث.

تشير هذه النتائج إلى أن المشاكل في الرؤية يمكن أن تتجلى بصيغ موزعة وتعتمد على المهام، مما يفتح آفاق جديدة لفهم وتحسين عملية التفكير في نماذج الذكاء الاصطناعي.