في عالم الذكاء الاصطناعي، يظل تحسين التفضيلات (Preference Optimization) عنصرًا حاسمًا في تعزيز التفكير الرياضي داخل نماذج اللغات الكبيرة (LLMs). ومع ذلك، فإن اعتماد نماذج موثوقة تعتمد عادةً على الإجابات المثبتة أو على الملاحظات البشرية أو على نماذج مكافآت خارجية. أظهرت دراسة جديدة إمكانية استخلاص إشراف التفضيلات من الهندسة الداخلية لتمثيلات النموذج في بيئة شبه إشرافية.

تُظهر التحليلات أن مسارات التفكير التي تتولد عبر مشكلات رياضية مختلفة تشكل سحب بيانات (Point Clouds) ذات هيكلية محددة، حيث تختلف التنظيمات الهندسية للمسارات الصحيحة عن تلك الخاطئة. بناءً على هذا الاكتشاف، تم اقتراح إطار عمل Cloud-ScPO، الذي يعتمد على توجيه الطTopology-guided preference-mining framework لتحسين تفضيلات الإجابة.

يسمح Cloud-ScPO باستخدام مجموعة صغيرة من البيانات الموصوفة لبناء سحب مرجعية متعددة تحتوي على الإجابات الصحيحة والخاطئة. يتم تمثيل كل مسار بحالة خفية متوسطة ويتم تقييمه باستخدام مقياس الجوار $k$ الأضعف عبر بنوك مرجعية. نقوم بدمج إشارة سحابة عبر المشكلات مع اتساق ذاتي على مستوى التعليمات، حيث يحدد الاتساق الذاتي اتجاه تفضيلات الإجابات، بينما تساعد سحابة البيانات في انتقاء المسارات المحددة وفحصها بناءً على حدود الدرجات.

أظهرت التجارب التي أُجريت على مجموعة البيانات GSM8K وMATH-Numeric عبر أربع إعدادات نموذجية تحسن Cloud-ScPO بشكل مستمر مقارنةً بـ ScPO، مع زيادات تصل إلى 4.49% على GSM8K و4.19% على MATH-Numeric. كما تظهر التحليلات على مستوى الزوج أن Cloud-ScPO يحافظ على موثوقية مماثلة للدقة مع فصل أكثر فعالية للمسارات المفيدة عما دونها من الإجابات غير المكتملة أو المكررة أو ذات الجودة المنخفضة.

تبدو آفاق تحسين الذكاء الاصطناعي في مواجهة التحديات الرياضية من خلال هذه الأساليب الجديدة أكثر إشراقًا، مما يفتح المجال لمزيد من الإبداع في تطوير نماذج الذكاء الاصطناعي في المستقبل.