في خطوة مُبَشّرة تُعزز من إمكانيات الذكاء الاصطناعي، قدم فريق من الباحثين نموذجًا جديدًا يحمل عنوان OmniReasoning، الذي يدفع حدود التفكير المشترك السمعي البصري إلى آفاق جديدة. يعتمد هذا النموذج على فكرة دمج السمع والرؤية بلغة واحدة، مما يتيح فهمًا أعمق وأكثر تكاملًا للمعلومات.
يُعاني الذكاء الاصطناعي حاليًا من تحديات كبيرة، حيث يتم التعامل مع الحواس السمعية والبصرية ككيانات مستقلة دون استغلال فعّال لفرص التفاعل بينها. لذلك، قام الباحثون بتطوير معيار جديد يُدعى OmniReasoningBench، والذي يتطلب الاستفادة من كل من الأدلة السمعية والبصرية للإجابة على 1150 سؤالًا متنوعًا.
ولمزيد من الفعالية، تم ابتكار محرك بيانات يُدعى OmniQA، الذي يقوم تلقائيًا بإنشاء أزواج من البيانات المبنية على الأدلة وتوفير سلاسل تلميحات موثوقة، مما يسهل عملية التفكير والتفسير. وبهذا التحول، تم إنتاج بيانات تدريب جديدة، مثل OmniReasoning-SFT-112K و OmniReasoning-RL-19K.
علاوة على ذلك، تم اقتراح طريقة جديدة للتعليم الذاتي تُعرف بـ Modality-Factored Self-Distillation (MFSD) التي تقيّم كل استجابة عبر سياقات أدلة محددة، لتفكيك المساهمات الفردية لتلك الأدلة والتفاعلات بين الحواس.
مع هذه التطورات، حقق نموذج OmniReasoning-30B-A3B درجة 50% على OmniVideoBench و42.5% على OmniReasoningBench، مما يمثل تحسنًا ملحوظًا مقارنة بالنموذج الأساسي Qwen3-Omni-30B-A3B-Thinking.
تتطلع هذه الدراسة إلى أن تكون خطوة قوية نحو تعزيز البحث المستقبلي في مجال التفكير المشترك السمعي البصري، مما يعد بمزيد من الابتكارات والتطبيقات المثيرة في عالم الذكاء الاصطناعي.
اكتشاف حدود جديدة في التفكير المشترك السمعي البصري مع OmniReasoning!
تقدم دراسة جديدة نموذج OmniReasoning الذي يدمج السمع والبصر بلغة واحدة، مما يعزز قدرة التفكير المشترك. كما يقدم هذا البحث معيارًا جديدًا وأدوات تدريب مبتكرة تفتح آفاقًا جديدة في الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
