في عالم الذكاء الاصطناعي، تعد الكفاءة والسرعة من العناصر الأساسية لتحقيق نتائج أفضل. ومع تزايد استخدام الطلبات الطويلة، ظهر تحدي جديد يتمثل في مشكلة التداخل الزمني أثناء معالجة الطلبات، والذي يمكن أن يؤثر سلبًا على أداء النظام. في هذا السياق، قدم أحد الأبحاث الجديدة آلية مبتكرة تُعرف باسم Decode-Latency Feedback Prefill (DLFP).

تعمل DLFP كوحدة تحكم مستقلة عن النموذج، حيث تقوم بتغيير عمل الفوترة المسبق فقط في الأوقات التي تداخل فيها مع عمليات التشفير النشطة. بعد دورة جدولة محمية، تستخدم DLFP الفترات التي تم ملاحظتها كتعليق متناسب لتعديل حجم الفوترة المسبق للتشفير التالي. هذا يتيح للعمليات الفردية العمل بدون قيود.

تم تنفيذ DLFP في بيئة vLLM وتم تقييم أدائها باستخدام بيانات وصفية حقيقية من NVIDIA، وأظهرت التجارب نتائج مذهلة. حيث تم تقليل زمن التداخل P99 بين الرموز بنسبة متوسطة بلغت 27.7%، مع الالتزام بمعايير مستوى الخدمة المحددة. لكن، يجب ملاحظة أن هذا التحسين يأتي بتكلفة، حيث زاد زمن الاستجابة الأول بنسبة 34.8%.

من المثير للاهتمام أن هذه الآلية لم تعمم على نماذج أخرى مثل Qwen3-8B وQwen3-32B، مما يسلط الضوء على حدود الإسهام الحالي. وبينما تم تصنيف هذا العمل كنموذج أولي قابل للتكرار، فإنه يفتح الأبواب لتطوير آليات تحكم جديدة تتناسب مع الأداء المتزامن على الأجهزة الذكية.