Hierarchical Abstract Tree for Cross-Document Retrieval-Augmented Generation
تقدم هذه الورقة -RAG، وهو إطار عمل جديد للجيل المعزز بالاسترجاع القائم على الأشجار، يستخدم فهرس شجرة تجريدية هرمية تكيفية ووكيل استرجاع متعدد الحبيبات للتغلب على قيود الطرق الحالية في التعامل مع الأسئلة متعددة القفزات عبر المستندات، محققاً أداءً هو الأفضل في فئته على الاختبارات المرجعية ذات الصلة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مكتبة ضخمة تحتوي على ملايين الكتب والمقالات والمستندات. تريد طرح سؤال معقد يتطلب ربط النقاط عبر صفحات عديدة، مثل: "من هي زوجة الرجل الذي أنتج الوثائقي عن المغنية التي ألهمت بيونسيه؟"
محركات البحث التقليدية ("الطريقة القديمة") تشبه أمين مكتبة يقوم فقط بجلب بضع صفحات عشوائية تحتوي على كلمات مثل "بيونسيه" أو "وثائقي". إنها غالبًا ما تفشل في إيجاد الرابط الجوهري للرجل المحدد الذي تسأل عنه لأنها لا تفهم القصة التي تربط بينهم.
تحاول أنظمة أخرى متقدمة تنظيم هذه الكتب في شكل شجرة (هيكل هرمي حيث توجد ملخصات كبيرة في الأعلى وتفاصيل أصغر في الأسفل). ومع ذلك، تشير الورقة البحثية إلى أن أنظمة الشجر الحالية بها ثلاثة عيوب رئيسية:
- تفرض شكلاً غير مناسب على واقع مختلف: فهي تفترض أن المعلومات موزعة بالتساوي، وهذا ليس صحيحًا، مما يربك النظام عندما تكون بعض المواضيع نادرة وأخرى شائعة.
- هي جزر معزولة: فالفروع في الشجرة لا تتواصل مع بعضها البعض بشكل جيد. إذا كانت الإجة تتطلب الانتقال من فرع إلى آخر، فإن النظام يتعثر.
- هي فضفاضة للغاية: فـ "الملخص" الموجود في قمة الشجرة يكون عامًا جدًا لدرجة أنه ينسى التفاصيل المحددة اللازمة للإجابة على سؤال دقيق.
الحل: Ψ-RAG (ساي-راج)
يقترح المؤلفون نظامًا جديدًا يسمى Ψ-RAG. فكر فيه كأنه أمين مكتبة فائق الذكاء ومتكيف؛ فهو لا يكتفي بتنظيم الكتب فحًا، بل يفكر بنشاط في كيفية العثور على الإجابة.
إليك كيف يعمل، مقسمًا إلى جزأين رئيسيين:
1. شجرة "الدمج والانهيار" (إعادة تنظيم المكتبة)
بدلاً من فرض تصنيفات محددة مسبقًا على الكتب (مثل "رياضة" أو "تاريخ")، يقوم Ψ-RAG ببناء خريطته الخاصة بناءً على مدى تشابه النصوص فعليًا.
- التشبيه: تخيل أن لديك كومة من قطع "الليغو" المختلطة. بدلًا من فرزها حسب اللون أولاً، تبدأ بربط القطع المتشابهة معًا. إذا وجدت قطعتين تتناسبان تمامًا، تقوم بلصقهما. وإذا وجدت مجموعة صغيرة تندرج تحت مجموعة أكبر، تقوم بإلحاقها بها.
- النتيجة: هذا ينشئ "شجرة تجريدية هرمية". الطبقة السفلية تحتوي على قطع النصوص الفعلية. أما الطبقات التي فوقها فهي عبارة عن ملخصات (تجريدات) للطبقات التي تحتها.
- لماذا هو أفضل؟ على عكس الأنظمة الأخرى التي تحاول جعل جميع الفروع بنفس الحجم (مما يفسد المواضيع النادرة)، يسمح Ψ-RAG للشجرة بالنمو بشكل طبيعي. إذا كان الموضوع نادرًا، يحصل على فرعه الصغير والمتميز الخاص به. وإذا كان الموضوع ضخمًا، يحصل على فرع كبير. هذا يحافظ على "شكل" المعلومات.
2. "الاسترجاع الوكيل متعدد المستويات" (العميل المحقق)
هذا هو عقل العملية. إنه ليس مجرد شريط بحث؛ بل هو عميل ذكاء اصطناعي محقق يمكنه التحدث مع المكتبة.
- وظيفة المحقق: عندما تطرح سؤالًا، لا يكتفي العميل بالبحث لمرة واحدة. بل ينظر إلى قمة الشجرة (الملخصات الكبيرة) لأخذ الفكرة العامة. إذا لم تكن الإجابة موجودة، يسأل نفسه: "ما هي التفاصيل المحددة التي تنقصني؟"
- إعادة تنظيم الاستعلام: إذا أدرك العميل أنه عالق، فإنه يعيد كتابة سؤالك ليكون أكثر تحديدًا.
- السؤال الأصلي: "من هي زوجة الرجل الذي أنتج الوثائقي...؟"
- سؤال العميل المعاد صياغته: "من هي زوجة ديفيد جيست؟" (بعد معرفة اسم الرجل في الخطوة الأولى).
- البحث الهجين: يستخدم العميل أداتين في آن واحد:
- الشجرة: لفهم الصورة الكبيرة واتباع المسار المنطقي.
- البحث بالكلمات المفتاحية (الفهرس المتناثر): للعثور على الأسماء والحقائق الدقيقة التي قد تضيع في الملخصات الواسعة.
- الحلقة المستمرة: يستمر العميل في السؤال: "هل لدي معلومات كافية؟" إذا لم يكن كذلك، فإنه يتعمق أكثر، ويعيد كتابة السؤال، ويبحث مرة أخرى حتى يكتمل لديه القصة كاملة.
لماذا هذا مهم (وفقًا للورقة البحثية)
اختبرت الورقة هذا النظام على أسئلة صعبة تتطلب استدلالًا "متعدد الخطوات" (ربط أ بـ ب، ثم ب بـ ج، ثم ج بالإجابة).
- السرعة مقابل الدقة: كانت أنظمة الشجر الأخرى سريعة ولكنها غير دقيقة في مجموعات البيانات الكبيرة. أما الأنظمة القائمة على الرسوم البيانية (التي ترسم العلاقات مثل خريطة مترو الأنفاق) فكانت دقيقة ولكن بناءها بطيء جدًا.
- الفائز: كان Ψ-RAG أكثر دقة بنسبة 25.9% من أفضل نظام شجري سابق (RAPTOR) وأكثر دقة بنسبة 7.4% من أفضل نظام رسوم بيانية (HippoRAG 2).
- الكفاءة: قام ببناء فهرسه بسرعة تزيد بـ 6.5 مرة عن RAPTOR، وكان أسرع بكثير من أنظمة الرسوم البيانية، مما يجعله عمليًا للمجموعات الضخمة من المستندات.
باخت تنظيمًا
إن Ψ-RAG هو طريقة جديدة لتنظيم والبحث في كميات هائلة من النصوص. فهو يبني خريطة مرنة تحترم الهيكل الطبيعي للبيانات، ويستخدم "عميلًا" يعمل بالذكاء الاصطناعي للتنقل في هذه الخريطة، حيث يطرح أسئلة متابعة ويجمع بين الملخصات الواسعة والحقائق المحددة لحل الألغاز المعقدة التي تفشل الأنظمة الأخرى في حلها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.