في عالم الذكاء الاصطناعي، تتزايد أهمية النماذج اللغوية الكبيرة (Large Language Models) في مساعدة العلماء عبر مختلف مجالات العمل. من أبرز التحديات التي يواجهها الباحثون هو تحويل الأوصاف النصية إلى رسومات علمية عالية الجودة، غالبًا ما يُعبر عنها كبرامج TikZ، التي يمكن تحويلها إلى صور علمية.
لسوء الحظ، فإن مجموعات البيانات المستخدمة في تحويل النص إلى TikZ كانت صغيرة وغير دقيقة، مما أدى إلى عدم توافق بين النصوص والرسومات الناتجة. ولمواجهة هذه التحديات، تم تطوير مجموعة بيانات DaTikZ-V4، والتي تتفوق بأربعة أضعاف عن الإصدار السابق V3 من حيث الحجم والجودة.
تستخدم تيكزيلا نماذج Qwen مفتوحة المصدر (3B و8B) في عملية تدريب مزدوجة، تبدأ بالتعلم تحت الإشراف (Supervised Fine-Tuning) تليها مرحلة التعلم المعزز (Reinforcement Learning) التي تعمل على تحسين النتائج. لاستكمال هذه العملية، تم استخدام مشفر صور مُدرّب عبر الرسوم العكسية لتوفير إشارات مكافآت تتسم بالدقة.
أظهرت التقييمات البشرية الواسعة، التي شملت أكثر من 1000 تحكيم، أن تيكزيلا حققت تحسينًا يتراوح بين 1.5 إلى 2 نقطة مقارنة بالنماذج الأساسية، وتفوقت على نموذج GPT-4o بنقطة واحدة، ونجحت في تحقيق نتائج مشابهة لنموذج GPT-5 في التقييم المعتمد على الصور، مع الاحتفاظ بحجم نموذجي أصغر بكثير.
إن هذه الإنجازات ليست مجرد قفزات نوعية في الأداء، بل تمثل تحولًا كبيرًا في كيفية استخدام الذكاء الاصطناعي لتحسين عمليات البحث العلمي وتقديم رسومات معقدة بدقة فائقة.
تيكزيلا: نقلة نوعية في تحويل النصوص إلى رسومات علمية باستخدام بيانات عالية الجودة وتعلم تعزيز
تقدم تيكزيلا Dataset DaTikZ-V4، مما يحل أزمة جودة البيانات في تحويل النص إلى رسم TikZ. بفضل التعلم المعزز، حققت نماذج تيكزيلا تحسينات ملحوظة في الأداء مقارنةً بالنماذج السابقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
