← أحدث الأبحاث
🔬 materials science

VecTree-RAG: An Agentic Retrieval-Augmented Generation Framework Combining Vector and Tree Retrieval for Efficiency and Accuracy

يُعد VecTree-RAG إطار عمل للجيل المعزز بالاسترجاع الوكيل، يجمع بين البحث المتجه لتصنيف المستندات على مستوى المجموعة النصية وبين التنقل في الأشجار الموجه بالاستدلال لتحديد موقع الأدلة بدقة، محققاً أداءً هو الأفضل حالياً وكفاءة محسنة في اختبارات الإجابة على الأسئلة العلمية من خلال الحفاظ على السياق الهيكلي للأدبيات الأكاديمية والاستفادة منه.

المؤلفون الأصليون: Xinyan Zhong, Yuwei Shi, Yuqi Wei, Chen Shen, Tianhang Zhou, Zhenghao Wu

نُشر 2026-07-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xinyan Zhong, Yuwei Shi, Yuqi Wei, Chen Shen, Tianhang Zhou, Zhenghao Wu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حل لغز ضخم ومتعدد الطبقات، ولكن بدلاً من دفتر ملاحظات واحد، لديك مكتبة تحتوي على آلاف الكتب الضخمة والمعقدة. في عالم الذكاء الاصطناعي، يمثل هذا تحدي "الإجابة على الأسئلة العلمية". يحتاج العلماء والحواسيب إلى العثور على الإجابات الصحيحة المختبئة داخل الأوراق البحثية، لكن هذه الأوراق ليست مجرد قوائم من الحقائق؛ بل هي قصص منظمة ذات فصول، وطرق عمل، وأشكال توضيحية، وحجج.

ولمعالجة ذلك، يستخدم الباحثون تقنية تسمى "التوليد المعزز بالاسترجاع" (RAG). فكر في (RAG) كأنه أمين مكتبة فائق الذكاء، لا يكتفي بحفظ الحقائق فحسب، بل يمكنه الخروج، والعثور على الكتاب المناسب، وقراءة الصفحات ذات الصلة، ثم كتابة إجابة مثالية لك. ومع ذلك، يرتكب أمناء المكتبات التقليديون خطأً شائعاً: فهم يمزقون الكتب إلى قصاصات صغيرة وعشوائية (مثل الجمل المنفردة) ويمزجونها جميعاً معاً في كومة ضخمة. إذا طرحت سؤالاً، سيقوم أمين المكتبة بالتقاط حفنة من هذه القصاصات. والمشكلة هي أن قصاصة تتحدث عن طريقة علمية قد تجد نفسها بعيدة جداً عن النتائج التي تشرحها، أو قد يُفقد السياق، مما يترك الذكاء الاصطناعي في حالة ارتباك حول ما تعنيه تلك القصاصة فعلياً. الأمر يشبه محاولة حل لغز "بازل" (Jigsaw puzzle) بعد أن قام شخص ما بخلط قطع من ألف لغز مختلف في صندوق واحد.

يقدم هذا البحث طريقة جديدة وأكثر ذكاءً لتكون أمين المكتبة هذا. فقد بنى الباحثون، بقيادة شين يان تشونغ وزينغ هاو وو، نظاماً يسمى VecTree-RAG. وبدلاً من تمزيق الكتب، يحترم هذا النظام الهيكل الأصلي للوثائق. فهو يستخدم استراتيجية "تحديد الموقع ثم القراءة" المكونة من خطوتين. أولاً، يستخدم ماسحاً ضوئياً عالي السرعة للعثور بسرعة على الكتب والفصول المناسبة (باستخدام البحث "المتجهي" - Vector search، وهو ما يشبه مطابقة "روح" أو معنى سؤالك مع عنوان الكتاب وملخصه). ثان، بمجرد معرفة الكتاب والفصل الذي يجب النظر فيه، يستخدم نظام ملاحة "شجري" (Tree) للتنقل عبر هيكل الوثيقة، والعثور على الصفحة الدقيقة التي توجد فيها الأدلة. إنه لا يفتح الصفحات الثقيلة لقراءة التفاصيل الدقيقة إلا عندما يضطر لذلك تماماً. هذا النهج يحافظ على "قصة" العلم متماسكة، مما يضمن أن يرى الذكاء الاصطناعي الطرق والنتائج والاستنتاجات بترتيبها الصحيح.

اكتشاف الورقة البحثية

اختبر المؤلفون نظام "VecTree-RAG" الجديد مقابل أربعة أساليب أخرى شائعة على ثلاثة أنواع مختلفة من التحديات العلمية. أرادوا معرفة ما إذا كان الحفاظ على هيكل الوثيقة يساعد الذكاء الاصطناعي فعلياً في الحصول على إجابات أفضل وإيجاد الأدلة الصحيحة.

النتائج: فائز واضح
لم يكتفِ نظام "VecTree-RAG" بأداء جيد فحسب، بل تفوق على كل الأساليب الأخرى التي اختبرها الباحثون.

  • على أسئلة الورقة الواحدة (QASPER): عندما طُلب منه الإجابة على أسئلة بناءً على ورقة بحثية واحدة محددة، حقق "VecTree-RAG" درجة صحة قدرها 0.800 (كما حكم عليها ذكاء اصطناعي آخر). حققت الأساليب التالية أفضل النتما حوالي 0.750. والأهم من ذلك، كان "VecTree-RAG" أفضل بكثير في الإشارة إلى الصفحة الدقيقة التي وُجدت فيها الإجابة؛ حيث بلغت "دقة الأدلة" لديه 0.274، بينما عانت الأساليب الأخرى، وسجلت ما بين 0.046 و 0.071. وهذا يعني أن "VecTree-RAG" كان أقل عرضة لإضاعة الوقت في قراءة صفحات غير ذات صلة.
  • على إيجاد الورقة الصحيحة في مكتبة (LitQA2): عندما كانت المهمة هي تحديد أي من 61 ورقة بحثية تحتوي على الإجابة، حقق "VecTree-RAG" دقة بلغت 0.925. وتراوحت الأساليب الأخرى بين 0.759 و 0.889.
  • على دمج العديد من الأوراق (MOSAIC): كان هذا هو الاختبار الأصعب، حيث يتطلب من الذكاء الاصطناعي تركيب معلومات من 5 إلى 7 أوراق بحثية مختلفة للإجابة على سؤال واحد. سجل "VecTree-RAG" نتيجة 0.547، متفوقاً على ثاني أفضل نتيجة وهي 0.503.

ما تنفيه الورقة البحثية
يجادل الباحثون صراحةً ضد فكرة أن مجرد قراءة المزيد من النصوص أو تسطيح الوثائق إلى أجزاء عشوائية هو الحل. فقد وجدوا أن توسيع نطاق البحث ليشمل المزيد من المقاطع العشوائية (مثل نماذج "Dense RAG" الأساسية) جعل مهمة الذكاء الاصطناعي أصعب من خلال إضافة "الضجيج" والتكرار. تشير الورقة إلى أن إلقاء المزيد من البيانات على المشكلة دون فهم هيكل الوثيقة هو أمر غير فعال وغالباً ما يؤدي إلى إجابات أسوأ. كما أظهروا أن نظامهم لم يعتمد على التخمين؛ بل استخدم طريقة "الإفصاح التدريجي"، مما يعني أنه بدأ بملخصات صغيرة ومنخفضة التكلفة، ولم "يدفع" ثمن قراءة النص الكامل المكلفة إلا عندما تأكد من أنه على المسار الصحيح.

مدى ثقتهم؟
المؤلفون واثقون تماماً من هذه النتائج لأنهم اختبروا النظام على مجموعات بيانات حقيقية ومفتوحة المصথা مع أسئلة محددة مسبقاً. لم يكتفوا بمحاكاة النتائج، بل مرروا "وكلاء الذكاء الاصطناعي" الفعليين عبر الاختبارات عدة مرات (باستخدام ثلاث "بذور" أو نقاط بداية مختلفة) لضمان اتساق الدرجات. كما قاموا بقياس النتائج باستخدام قواعد صارمة، مثل وجود ذكاء اصطناعي منفصل لتقييم الإجابات مقابل الإجابات الصحيحة. وبينما يقرون بأن نظامهم يتطلب خطوات أكثر (وبالتالي وقتاً حاسوبياً أطول) من البحث البسيط ذي الخطوة الواحدة، إلا أنهم يثبتون أن هذا الجهد الإضافي يؤدي إلى دقة أعلى بكثير وتحديد أفضل للأدلة. تشير الورقة إلى أنه بالنسبة للأسئلة العلمية المعقدة، فإن هذا النهج "الواعي بالهيكل" يعد ترقية ضرورية للأساليب "المسطحة" القديمة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →