مع تزايد تعقيد المشاهد الرقمية، يصبح ترتيب الأجسام (Object Placement) أحد العناصر الأساسية في إنشاء صور متكاملة ومؤثرة. تقليديًا، كانت الأساليب المعتمدة تعتمد على قواعد تقليدية أو التعلم تحت إشراف على مجموعات بيانات محدودة، مما يحد من إمكانية التعميم والفهم، خاصةً في السيناريوهات المفتوحة التي تتضمن أجسامًا ومشاهد جديدة.
في هذا الصدد، تمثلت الخطوة الجديدة في إعادة صياغة ترتيب الأجسام في العالم المفتوح كمسألة بحث هرموني يتم توجيهه من خلال استدلال نموذج لغوي متعدد الوسائط (Multimodal Large Language Model - MLLM). نقدم لكم تقنية 'Presto'، وهو إطار عمل خالي من التدريب (Training-Free) يعمل ضمن مساحة عمل تخيلية (Imaginary Action Space) لتعديل موضع الأجسام وحجمها بشكل تكراري.
تستخدم تقنية Presto استراتيجية البحث من الخشنة إلى الدقيقة (Coarse-to-Fine Search Strategy) لضمان تماشي الأداء مع السرعة والثقة. كما نقيّم نوعين من اتخاذ القرار: الاختيار المدفوع بالمقاييس (Metric-guided Selection) ونموذج MLLM كقاضي (MLLM-as-a-Judge).
تظهر التجارب عبر مجموعة من المعايير أن تقنية Presto تحقق أداءً رائدًا بين التقنيات الحالية، خاصةً في البيئات الجديدة التي لم يسبق رؤيتها. وتوضح الدراسات البشرية أن النسخة MLLM-as-a-Judge تنتج مواقع أكثر توافقًا من الناحية الإدراكية مقارنة بالأساليب المدفوعة بالمقاييس، مما يكشف عن فجوة بين المقاييس القياسية للحكم البصري البشري.
تعتبر Presto خطوة نحو المستقبل في ترتيب الأجسام في المشاهد، حيث تعزز من إمكانية الإبداع وتعطي فرصًا جديدة في عالم التصميم الرقمي.
اكتشفوا تقنية Presto: تغيير قواعد لعب ترتيب الأجسام في المشاهد!
تعرفوا على تقنية Presto المبتكرة، الإطار الخالي من التدريب والذي يقيم المواقع المناسبة للأجسام في المشاهد بشكل فعال. النتائج تبين تفوق هذه التقنية في بيئات مفتوحة مع أجسام جديدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
