في عالم علم الجينوم المتقدم، يلعب تحليل مجموعات الجينات دورًا محوريًا في فهم الوظائف البيولوجية، إلا أن هذه العملية تتطلب جهدًا كبيرًا وتعتمد بشكل كبير على التفسير اليدوي. في خطوة رائدة، ظهرت نماذج اللغات الضخمة (Large Language Models) كأدوات فعّالة، لكن معظم الطرق التقليدية تركزت على الأسماء الرمزية للجينات، مما جعلها تفتقر إلى فهم دقيق للتركيبات البيولوجية المتخصصة.

لذا جاء نموذج SoftGene، كمقترح ثوري يهدف إلى تحسين تحليل مجموعات الجينات عبر الاستفادة من الهياكل الهرمية لهذه المجموعات. يعتمد النموذج على تقنية الترميز القائم على الانتباه الهرمي، مبنيًا على نموذج البروتين ESM، حيث يمثل كل مجموعة جينية باستخدام معلومات تسلسل الأحماض الأمينية.

إن أحد التحسينات البارزة في SoftGene هو استخدام نظام طلب هجين يجمع بين العروض المرنة المشتقة من تمثيلات مجموعة الجينات ومشاركات شديدة تتضمن سياقات إضافية تم إنشاؤها بواسطة LLM، مما يؤدي إلى تعزيز الدقة في التحليل.

قمنا بتقييم هذا النموذج الجديد على مجموعتين مرجعيتين هما: سمة جينات الجينوم (Gene Ontology) وقاعدة بيانات التوقيعات الجزيئية (Molecular Signatures Database). أظهرت النتائج أن دمج التمثلات الخاصة بالتسلسلات البروتينية مع السياقات النصية يحسن بشكل كبير من دقة توضيح مجموعات الجينات، حيث كشفت التحليلات عن اختلافات ملحوظة في تأثير تمثيلات البروتين عبر المجالات البيولوجية المختلفة.