تعتبر النماذج اللغوية الكبيرة (LLMs) من أبرز التطورات في مجال الذكاء الاصطناعي، حيث يمكنها حل عدد من المهام الخاصة بكفاءة. ومع ذلك، فإن استعلام هذه النماذج بشكل منفصل لملايين المواقف ذات الصلة قد يؤدي إلى تكاليف باهظة. هنا تأتي فكرة 'تعبئة المهام' (Bottling)، التي تشير إلى قدرة الوكلاء على تحويل الإمكانيات العامة إلى حلول خاصة بالمهام، مما يحقق توازناً بين جودة الإجابة والتكلفة الإجمالية.

في المعايير الجديدة المعروفة باسم BOTTLED، يتعين على الوكلاء التعامل مع عبء عمل كامل غير مصنف وإكماله ضمن ميزانيات زمنية وحاسوبية محددة، بالإضافة إلى ميزانية واجهة برمجة التطبيقات للنموذج اللغوي. يختار الوكلاء أساليبهم الخاصة، سواء من خلال تدريب نموذج صغير أو كتابة برنامج قابل لإعادة الاستخدام.

أظهرت النتائج عبر عشرة نماذج وثلاثة مهام أن الأداء الجيد في المهام دون إشراف لا يترجم دائماً إلى قدرات تعبئة قوية. فقد تختلف النماذج ذات الدرجات المتشابهة بشكل كبير عند التعبئة، حيث كانت 48 من أصل 60 عملية تعبئة تسجل أدنى من الحد الأدنى لفترة الثقة بنسبة 95% وفقاً لأداء النموذج في المهام دون إشراف. ومع ذلك، فإن عملية التعبئة يمكن أن تؤدي إلى توفيرات كبيرة: حيث تحتفظ Opus 5 بحوالي 82% من نتيجة الماكرو-F1 بدون إشراف بتكلفة تقل بحوالي 657 مرة.

تعتبر فكرة التعبئة أيضاً تنافسية مع نموذج Jev، الذي صمم خصيصاً للاستخراج المتكرر بأسعار منخفضة، حيث تستعيد Opus 5 حوالي 94% من نتيجة Jev في نفس المهمة بتكاليف أقل بكثير. يوفر نموذج BOTTLED أساساً لتقييم وتحسين قدرة الوكلاء على استثمار الموارد المحدودة في حلول قابلة لإعادة الاستخدام من أجل عبء الأعمال الكبيرة والمتكررة.