في عالم الذكاء الاصطناعي، تلعب البيانات الاصطناعية عالية الجودة دورًا محوريًا في تطوير نماذج اللغة الكبيرة (Large Language Models) القابلة للتكيف. غير أن الطريقة التقليدية في تحفيز هذه النماذج أو الاعتماد على سيناريوهات الاستخدام النهائي غالبًا ما تؤدي إلى إنتاج بيانات ذات تنوع منخفض، مما يؤدي إلى انهيار النماذج نحو صيغ شائعة.

لذلك، قدم الباحثون مؤخرًا طريقة جديدة تستند إلى شبكات التدفق التوليدية (Generative Flow Networks) لإنشاء بيانات اصطناعية عالية الجودة تتميز بالتنوع. باستخدام أساليب مبنية على تحليل هيكل المحادثات الكامنة من خلال توزيع مختلط غاوسي، تمكنوا من ضم استراتيجيات الخبراء بشكل متناسب مع تواجدهم في بيانات التدريب.

تمت تجربة هذه الطريقة عبر مجالين مختلفين: المحادثات التعليمية والدعم العاطفي. وأظهرت النتائج أن نهج توليد البيانات الاصطناعية المستند إلى شبكات التدفق يحقق توازنًا أفضل من حيث الأصالة والموثوقية مقارنة بأساليب التعلم التعزيزي والنماذج المتكاملة.

عند تقييمها على ثلاث مهام مختلفة للتنبؤ، أظهرت النماذج المدربة على المحادثات المولدة بواسطة شبكة التدفق نتائج أفضل من غيرها من طرق التوليد المنافسة. وهذا ما يفتح الأفق أمام تطورات جديدة في كيفية تحسين تطبيقات الذكاء الاصطناعي عن طريق بيانات اصطناعية متنوعة وجودة.