في عصر تتسارع فيه التطورات التقنية، تبرز الحاجة إلى أدوات تعليمية تواكب هذا التقدم. تُظهر نماذج اللغات الضخمة (Large Language Models) وعدًا كبيرًا في تحسين التجربة التعليمية، ولكنها غالبًا ما تفتقر إلى الانسجام مع المواد الدراسية المحددة. في هذه الدراسة، نقوم بمقارنة تقنيتي استرجاع المعلومات المعزز (Retrieval-Augmented Generation - RAG) وGraphRAG من أجل الإجابة على الأسئلة بمستوى الصفحة في كتاب رياضيات للمرحلة الجامعية.

قمنا باستخدام مجموعة بيانات مكونة من 477 زوجًا من الأسئلة والأجوبة، كل منها مرتبط بصفحة محددة في الكتاب المدرسي. وبتطبيق خمسة نماذج RAG المعتمدة على التضمين، إلى جانب نموذج قاعدة BM25، قمنا بتقييم الأداء عبر دلالتين رئيسيتين: دقة الاسترجاع (ما إذا كانت الصفحة الصحيحة قد تم استرجاعها) وجودة الإجابة (مقياس F1).

أظهرت النتائج أن نماذج RAG المبنية على التضمين تفوقت بشكل واضح على GraphRAG من حيث استرجاع الصفحات، حيث حقق نموذج voyage-3-large دقة تبلغ 99.4% في أول 10 استرجاعات. بينما أثبت نموذج BM25 أنه قاعدة قوية، متفوقًا على العديد من نماذج التضمين.

وعبر تحليل الأخطاء، تبين أن 63.3% من حالات الفشل في الصفحة الأولى كانت تسترجع محتوى من نفس الفصل، مما يشير إلى أهمية بيداغوجية حتى في حالات الفشل. ورغم أن GraphRAG استرجع سياقًا زائدًا يتجاوز ~47 ألف كلمة، إلا أن جودة التوليد كانت أقل بكثير (3.7 ألف كلمة لـ RAG).

بالإضافة إلى ذلك، قمنا بإعادة تنفيذ التجارب الرئيسية باستخدام نموذج LLM مفتوح المصدر (Qwen3.5-35B-A3B)، ووجدنا أن فوائد RAG كانت أكبر بشكل متناسب للنماذج الأقل قوة (+39% مقابل +16% تحسن نسبي في مقياس F1). تعد هذه النتائج مهمة جدًا للتطبيقات التعليمية المدعومة بالذكاء الاصطناعي التي تتطلب توجيهًا دقيقًا نحو صفحات الكتب المدرسية.

إذا كنت مهتمًا بتطورات الذكاء الاصطناعي في التعليم، فما رأيك في هذه النتائج؟ شاركنا آراءك في التعليقات!