في عالم الذكاء الاصطناعي، تعتبر النماذج اللغوية الصغيرة (Small Language Models) خيارًا مغريًا كثيرًا في أدوار السيطرة المحلية حيث تقلل من الحاجة إلى معالجة بيانات بعيدة، مما يخفض زمن الاستجابة والأثر البيئي. ومع ذلك، قد تؤدي الأخطاء في الأدوات الهيكلية إلى فشل خطوات الوكيل في تنفيذ المهام.

تتنافس الأنظمة التقليدية عادةً لاختيار النماذج مرة واحدة لكل استعلام، لكن وكالات الذكاء الاصطناعي تواجه نقاط قرار متسلسلة، وصعوبة هذه النقاط تتغير دائمًا بناءً على الملاحظات المتوسطة. هنا يأتي دور STEPGATE - وهو إطار عمل ثوري يضمن تحكمًا أفضل من خلال تقييم الذكاء لكل فعل محلي من نماذج SLM ورفع مستوى التحديات إلى نموذج أقوى عند الحاجة.

أظهرت التجارب المبدئية على 52 مهمة مغلقة أن استخدام نموذج Qwen2.5-1.5B/7B مع STEPGATE يوفر نجاحًا في الأداء بنسبة 82.7% مع تصعيد بنسبة 30.8%. في المقابل، حقق النظام التقليدي نجاحًا بنسبة 67.3% باستخدام المعالجة المحلية فقط.

وفي اختبارات متعددة الجولات، أثبت STEPGATE فعاليته بحصوله على نسبة نجاح تبلغ 69.0% لمسار النجاح و84.0% لنجاح الأفعال، رغم أنه اعتمد فقط على 30.0% من الأعمال السحابية. بالمقارنة، كانت نتائج العمليات المحلية وحدها 48.0% و70.5% على التوالي.

هذه النتائج تشير بوضوح إلى أن التصعيد على مستوى الخطوات يمكن أن يعيد جزءًا كبيرًا من الفجوة في الأداء مقارنة بنماذج أقوى، كل ذلك مع تقليل عدد الرموز التي يتم نقلها عن بعد.

ومع ذلك، يجب التنويه إلى أن التقييمات الحالية مقيدة بنموذج واحد عائلي ونموذج أقوى واحد ومهام مكتوبة، مما يجعل النتائج عرضة للمزيد من الأبحاث والتجارب القادمة. فما رأيكم في هذا التطور؟ هل تعتقدون أن مستقبل الذكاء الاصطناعي سيكون في النقاط الأكثر تفصيلاً؟ شاركونا آرائكم في التعليقات!