Vector RAG vs LLM-Compiled Wiki: A Preregistered Comparison on a Small Multi-Domain Research
تجد هذه الدراسة المسجلة مسبقاً، والتي تقارن بين نظام استرجاع المعلومات المدعوم بالمتجهات (Vector RAG) والويكي المُعدّ بواسطة النماذج اللغوية الكبيرة (LLM-compiled wikis) لغرض التوليف البحثي متعدد المجالات، أنه في حين تتفوق الويكي في الربط بين الأوراق البحثية ودعم الاستشهاد على مستوى الادعاء، فإن نظام (RAG) أكثر فعالية من حيث التكلفة للبحث عن الحقائق الفردية، مما يثبت عدم وجود بنية واحدة مثالية توازن بين تنظيم الأدلة، ودقة الاستشهاد، والتكلفة التشغيلية.
تخيل أن لديك مكتبة ضخمة تضم 24 ورقة بحثية حول مواضيع مثل أخلاقيات الذكاء الاصطنا، وتغير المناخ، والطب. تريد أن تطرح على مساعد ذكاء اصطنا-ئي فائق الذكاء أسئلة تتطلب قراءة جميع هذه الأوراق وربط النقاط ببعضها البعض.
تقارن الورقة البحثية بين طريقتين مختلفتين لبناء هذا المساعد الذكي:
نظام "الاسترجاع المتجهي - RAG" (أمين المكتبة مع كشاف ضوئي): يعمل هذا النظام مثل أمين مكتبة، عندما تطرح عليه سؤالاً، يركض فوراً إلى الرفوف، ويجلب بضع صفحات محددة (قطع نصية) تبدو ذات صلة، ثم يسلمها للذكاء الاصطنا لكي يكتب الإجابة. إنه سريع ورخيص الثمن، لكنه لا يرى إلا الصفحات المحددة التي جلبها. إذا كانت الإجابة تتطلب ربط أفكار من ثلاثة كتب مختلفة، فقد يغفل أمين المكتبة عن هذا الرابط.
"ويكي المُجمّع بواسطة LLM" (كاتب الموسوعة): قبل أن تطرح أي سؤال، يأخذ هذا النظام جميع الأوراق الـ 24 ويعيد كتابتها باستخدام ذكاء اصطناعي يحاكي البشر إلى موسوعة واحدة ضخمة على طراز ويكيبيديا ومترابطة. عندما تسأل سؤالاً، لا يبحث الذكاء الاصطنا-ئي في الأوراق الأصلية؛ بل يتصفح هذه الموسوعة المكتوبة مسبقاً. الفكرة هي أنه بما أن الموسوعة منظمة ومترابطة بالفعل، يمكن للذكاء الاصطنا-ئي تقديم إجابة أكثر ترابطاً وتحليلاً.
السباق الكبير: ماذا حدث؟
وضع الباحثون اختباراً عادلاً ومعماً (blind test) حيث أجاب كلا النظامين على نفس الـ 13 سؤالاً الصعباً. إليكم ما وجدوه، باستخدام تشبيهات بسيطة:
1. اختبار "الصورة الكبيرة" (ربط النقاط)
التوقعات: كان من المتوقع أن يفوز نظام "الويكي" بسهولة في ربط الأفكار عبر الأوراق المختلفة.
النتيجة: فاز "الويكي" بالفعل، ولكن ليس بالقدر الذي كان مأمولاً. لقد كان بارعاً في نسج قصة موحدة. ومع ذلك، وجد الباحثون "شفرة غش" لأمين المكتبة (RAG): إذا أخبرت أمين المكتبة بأن يقسم السؤال الكبير إلى أسئلة فرعية أصغر ويبحث عن كل منها على حدة، فإن أمين المكتبة سيلحق بالويكي تماماً تقريباً.
الدرس المستفاد: إن ميزة "الويكي" في "ربط النقاط" تأتي في الغالب من كيفية تفكيكه للبحث، وليس فقط من كونه كتاباً مكتوباً مسبقاً.
2. اختبار "التحقق من الحقائق" (هل كذبوا؟)
التوقعات: قد يخسر "الويكي" نقاطاً لأن إعادة كتابة الأوراق في شكل "ويكي" قد تغير الحقائق عن طريق الخطأ (مثل لعبة "الهاتف المكسور").
النتيجة: للمفاجأة، كان "الويكي" أفضل في دعم ادعاءاته المحددة بالأدلة. فعندما قال "الويكي" إن "الحقيقة X صحيحة"، فقد أشار إلى صفحة تحتوي بوضوح على تلك الجملة. أما أمين المكتبة (RAG)، فقد كان غالباً ما يجلب صفحة قريبة من الحقيقة، لكن الذكاء الاصطنا-ئي "يهلوس" بتفصيل صغير أو يسيء قراءة رقم ما.
التحول المفاجئ: نظام التقييم القياسي (الذي نظر إلى الإجابة ككل) اعتقد أن أمين المكتبة (RAG) كان أفضل لأن إجاباته كانت أقصر وتقتبس نصوصاً دقيقة. ولكن عندما فحص الباحثون كل جملة على حدة، كان "الويكي" أكثر دقة في استشهاداته المحددة.
3. اختبار "التكلفة" (من هو الأرخص؟)
التوقعات: كان من المفترض أن يكون "الويكي" مكلفاً لبنائه (كتابة الموسوعة تستغرق وقتاً) ولكنه رخيص للاستخدام لاحقاً (تصفح كتاب أمر سريع).
النتيجة: هنا فشل "الويكي" فشلاً ذريعاً. على الرغم من أنه مبني مسبقاً، إلا أن طلب تصفح "الويكي" من الذكاء الاصطنا-ئي تطلب منه قراءة الكثير من النصوص مقارنة بأمين المكتبة.
التشبيه: تخيل أن أمين المكتبة يحضر لك 5 صفحات من الملاحظات. نظام "الويكي" يحضر لك كتاباً من 200 صفحة، ويطلب منك قراءة 150 صفحة منه، ثم كتابة ملخص.
الحسابات: كلف "الويكي" حوالي 21 ضعفاً أكثر لكل سؤال مقارنة بأمين المكتبة. فكرة أن "الدفع مقدماً يوفر المال لاحقاً" لم تنجح هنا؛ فقد انتهى الأمر بالمستخدم وهو يدفع علاوة باهلة في كل مرة يسأل فيها سؤالاً.
الحكم النهائي
تخلص الورقة البحثية إلى أنه لا يوجد نظام "مثالي". هناك مقايضة ثلاثية الأبعاد:
أمين المكتبة (RAG أحادي المرحلة): هو الأفضل إذا كنت تهتم بـ توفير المال وتحتاج فقط للعثور على حقيقة واحدة بسرعة.
أمين المكتبة "الذكي" (RAG المفكك): إذا قمت بتقسيم السؤال إلى أجزاء، فإن هذا الإصدار سيصبح جيداً في "ربط النقاط" بقدر يقارب "الويكي"، ولكن بتكلفة أقل بكثير (حوالي 3.4 مرات أرخص من "الويكي").
الويكي: هو الأفضل إذا كنت بحاجة إلى أن يستشهد الذكاء الاصطنا-ئي بادعاءات محددة بدقة عالية ولا تهتم بالتكلفة العالية. ومع ذلك، فهو مكلف جداً للتشغيل.
الخلاصة: لا يمكنك الحصول على كل شيء. يمكنك الحصول على نظام رخيص، أو نظام يربط الأفكاء جيداً، أو نظام يستشهد بالأدلة بشكل مثالي، ولكن في هذه التجربة، لم يكن أي نظام هو الأفضل في الثلاثة معاً. فكرة "الويكي" ليست حلاً سحرياً؛ إنها مجرد نقل للمشكلة من "البحث عن الصفحات الصحيحة" إلى "دفع فاتورة ضخمة مقابل قراءة الكثير من النصوص".
ملخص تقني: الـ RAG المعتمد على المتجهات مقابل الويكي المُجمّع بواسطة LLM
بيان المشكلة
تتناول الورقة البحثية فجوة في المقارنات الكمية بين بنيتين مختلفتين للإجابة على الأسئلة عبر مجموعة بحثية: الـ RAG المعتمد على المتجهات (Vector RAG) والويكي المُجمّع بواسطة النماذج اللغوية الكبيرة (LLM-Compiled Wikis). وبينما تشير التعليقات غير الرسمية (مثل "الويكي الماركدواني الوكيل" لأندريه كارباثي) إلى أن تجميع الأبحاث في ويكي مترابط عبر الروابط أثناء عملية الإدخال قد يوفر قدرة فائقة على التوليف متعدد الأوراق، لم تُنشر أي مقارنة كمية مباشرة ومسجلة مسبقاً ضد نظام الـ RAG التقليدي القائم على تقسيم النصوص إلى قطع (chunks) ومتجهات.
تتقصى الدراسة ثلاثة مقايضات محددة:
التوليف (Synthesis): هل تتفوق بنية الويكي في ربط النتائج عبر أوراق بحثية متعددة؟
الدقة (Fidelity): هل تؤدي عملية إعادة كتابة الأوراق إلى صفحات ويكي إلى تدهور دقة المصدر أو الارتباط بالمصدر النقطي؟
التكلفة: هل تؤدي التكلفة المسبقة لبناء الويكي إلى تقليل تكاليف وقت الاستعلام، مما يخلق نقطة تعادل بعد عدد معين من الأسئلة؟
المنهجية
الدراسة عبارة عن مقارنة عمياء ومسجلة مسبقاً بين حَكَمين أُجريت على مجموعة ثابتة من 24 ورقة بحثية محكمة عبر ثلاثة مجالات (أخلاقيات الذكاء الاصطناعي والقانون، علوم المناخ، والطب الدقيق).
الأنظمة المقارنة:
Vector RAG: خط معالجة يتكون من جولة واحدة (استرجاع ثم توليد). يستخدم تقسيم المستندات المدرك للماركدوان، وتوسيع الاستعلامات المتعددة، والاسترجاع الهجين (كثيف ومتفرق)، وإعادة ترتيب (re-ranking) من نوع Cohere، وتصحيح التحقق المستوحى من CRAG. لا يقوم بعملية استرجاع أثناء التوليد.
LLM Wiki: عملية تجميع غير متصلة (offline) حيث يقوم نموذج لغوي كبير (LLM) بتحويل الأوراق إلى ويكي ماركدوان مستمر ومترابط (كيانات، مفاهيم، مصادر). عند الاستعلام، يستخدم وكيل (agent) يستخدم الأدوات لتصفح هذا الويكي (عرض الصفحات، قراءة المحتوى) لتوليد الإجابات.
التقييم:
الأسئلة: 13 سؤالاً تقييمياً عبر ست طبقات من الصعوبة (تسلسلي، تعارض، متعدد الخطوات، ظهور، سياسات، فحص الانحياز).
النماذج: استخدم كلا النظامين Claude Opus 4.7 (xhigh) لتوليد الإجابات.
التحكيم: تم تقييم الإجابات بواسطة GPT-5.4 (الحَكَم الأساسي) و Gemini 2.5 Pro (للموثوقية بين المحكمين) باستخدام ترتيب عشوائي أعمى.
المعيار (Rubric): أربعة معايير من 1 إلى 10: التأصيل (الادعاءات تعود للمصدر)، النزاهة الهيكلية (سرد موحد)، الوعي بالتعارض، والربط بين الأوراق (التوليف متعدد الخطوات).
الفرضيات:
H1 (التوليف): الويكي > RAG بفارق ≥ 2.0 نقطة في معايير التوليف للأسئلة متعددة الخطوات/الظهور.
مقارنة مسجلة مسبقاً: أول مقارنة كمية عمياء بين الويكي المجمع بواسطة LLM والـ Vector RAG.
نتائج منهجية التقييم: أظهرت أن الحكام (LLM judges) يتصرفون بشكل مختلف بناءً على مادية المعيار. اتفق الحكام بشكل وثيق على الربط بين الأوراق (تعريف ملموس) لكنهم أظهروا "انزياح الحَكَم السقفي" (ceiling-judge drift) في المعايير الشمولية مثل النزاهة الهيكلية، حيث وصل أحد الحكام (Gemini) غالباً إلى درجات مشبعة عند 10/10 للويكي.
تجريد التفكيك الاستكشافي (Exploratory Decomposition Ablation): تحليل لاحق لنسخة Decomposition-RAG (تفكيك الأسئلة إلى أسئلة فرعية) لعزل ما إذا كان تفوق الويكي ناتجاً عن تغطية الاسترجاع أم محاذاة التمثيل.
النتائج
1. التوليف والتنظيم (H1)
تفوق الويكي: تفوق الويكي بشكل كبير على RAG أحادي الجولة في الربط بين الأوراق (التوليف عبر الأوراق)، متجاوزاً العتبة المسجلة مسبقاً (+6.625 مقابل +2.0).
التنظيم: كان التفوق في النزاهة الهيكلية أضعف بعد تعديل الموثوقية بين المحكمين (+1.625)، مما جعله يقل قليلاً عن عتبة الـ +2.0.
تأثير التفكيك: استعاد متغير RAG القائم على التفكيك حوالي 88% من ميزة التوليف الخاصة بالويكي، مما قلل الفجوة إلى ما دون العتبة المسجلة. يشير هذا إلى أن ميزة التوليف في الويكي تعود أساساً إلى تغطية استرجاع أفضل عبر المستندات، وهو ما يمكن معالجته بتفكيك الاستعلامات في RAG.
2. التأصيل والدقة (H2)
درجة المعيار: حقق RAG الاختبار المسجل مسبقاً فيما يتعلق بالتأصيل لواقعة واحدة في طبقة فحص الانحياز (RAG > Wiki)، محققاً H2.
التحليل على مستوى الادعاء (بعد التجربة): كشف تحليل دقيق للادعاءات الذرية عن عكس في الآلية. بينما سجل RAG درجات أعلى في المعيار الشمولي، كانت الادعاءات المستندة في الويكي أكثر عرضة بـ ~2 مرة لأن تكون مدعومة بدقة بالنص المستشهد بها و أقل عرضة بـ ~4-5 مرات لأن تكون غير مدعومة مقارنة بـ RAG.
التفسير: يميل RAG إلى استرجاع قطعة (chunk) ثم التوليف/الاستنباط خارج نطاقها (مما يؤدي إلى تماسك شمولي ولكن بمحاذاة أقل صرامة). أما الويكي فيقوم بوضع الأدلة مسبقاً في "نماذج تشبه الادعاءات"، مما يؤدي إلى دقة أعلى في الاستشهاد، رغم أن هذا لا يضمن دقة ملف الـ PDF الأصلي (بما أن الويكي نفسه هو عملية تجميع).
3. عدم التماثل في التكلفة (H3)
تكلفة الاستعلام: فشل ميزة التكلفة المتوقعة للويكي تماماً. استهلك الويكي 21 ضعفاً من الرموز (tokens) لكل استعلام مقارنة بـ RAG (1.65 مليون مقابل 78 ألف رمز).
الاستهلاك التدريجي (Amortization): بما أن تكلفة الاستعلام أعلى، فإن "نقطة التعادل" لاسترداد تكلفة الإدخال هي رياضياً مستحيلة (سالب N). تم دحض حدس التكلفة القائل بأن "التجميع المسبق يدفع ثمن تسهيل الاستعلامات الأرخص" تحت الاختبار المجرى.
تكلفة الإدخال: لم يمكن الفصل في نسبة تكلفة الإدخال بسبب مشكلة في محاسبة تخزين الرموز المؤقت (prompt-cing) في القياس عن بعد (تجميع الرموز المخزنة وغير المخزنة)، لكن نتيجة جانب الاستعلام وحدها تفند فرضية H3 المركبة.
4. تجريد Decomposition-RAG
التوليف: أغلق Decomp-RAG فجوة التوليف مع الويكي ولكن بتكلفة رموز LLM أعلى بـ 3.4 مرة من RAG أحادي الجولة (رغم أنه لا يزال أرخص بـ 3.4 مرة من الويكي).
محاذاة الاستشهاد:لم يستعد Decomp-RAG ميزة الويكي في دعم الاستشهاد ادعاءً بادعاء (19.2% مدعوم مقابل 40.2% للويكي). يشير هذا إلى أن تغطية الاسترجاع ومحاذاة التمثيل هما آليتان منفصلتان.
الأهمية والاستنتاجات
تخلص الورقة إلى أن التوليف البحثي المأصل ليس قدرة واحدة. لم تتفوق بنية واحدة في جميع الأبعاد الثلاثة: التنظيم، ومحاذاة الاستشهاد، والتكلفة.
الـ RAG أحادي الجولة: الأفضل للاسترجاع الموجه للنقطة من حيث التكلفة.
الـ Decomposition-RAG: حل وسط قابل للتطبيق للتوليف متعدد الأوراق حيث الهيكل مهم، حيث يقدم ~88% من ميزة التوليف للويكي بتكلفة أقل بكثير، رغم أنه لا يزال يتخلف في محاذاة الاستشهاد الصارمة.
الـ LLM Wiki: متفوق في محاذاة ادعاء النموذج المستند إلى أثر الدليل (أي أن الصفحة المستشهد بها تدعم الادعاء مباشرة)، ولكن بتكلفة رموز باهظة لكل استعلام (~21 ضعف RAG) وبانتظار التحقق من دقة المصدر.
تؤكد الدراسة أن التقييمات يجب أن ترفع تقارير عن هيكل التوليف، ومحاذاة ادعاء الاستشهاد، والتكلفة بشكل منفصل بدلاً من دمجها في حكم واحد عن "التأصيل". كما تسلط النتائج الضوء على هشاشة تقييمات "النموذج كحَكَم" (LLM-as-judge) في المعايير الشمولية، مما يشير إلى ضرية ضرورة وجود تعريفات تشغيلية ملموسة لضمان الموثوقية بين المحكمين. العمل المستقبلي مطلوب للتحقق من دقة مصدر الويكي مقابل ملفات PDF الأصلية واستكشاف بنيات هجينة تجمع بين الاسترجاء التكراري وإصلاح الاستشهاد القائم على الادعاء.