← أحدث الأبحاث
💻 computer science

SimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic Search

تقدم هذه الورقة SimpleWikiSearch، وهي بيئة ويكيبيديا غير متصلة بالإنترنت محددة بالكامل وقابلة لإعادة الإنتاج، مع بناء صريح للمتن، وأكوام استرجاع، وعقود أدوات مصممة لتوحيد تقييم أنظمة البحث الوكيلية من خلال عزل متغيرات البيئة عن أداء الوكيل.

المؤلفون الأصليون: Guanming Xiong, Penghui Zhang

نُشر 2026-07-30
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Guanming Xiong, Penghui Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت فائق الذكاء كيف يجيب على الأسئلة باستخدام مكتبة ضخمة. تعطي الروبوت عقلاً (نموذج لغوي كبير) وتقول له: "اذهب وابحث عن الإجابة في الكتب!". لكن هناك عقبة: نجاح الروبوت لا يعتمد فقط على مدى ذكاء عقله، بل يعتمد كلياً على كيفية تنظيم المكتبة. هل المكتبة عبارة عن علية فوضوية حيث الكتب ممزقة إلى قصاصات صغيرة ومربكة؟ هل أمين المكتبة يسلمك الصفحة الصحيحة، أم مجرد جملة عشوائية؟ هل يُسمح للروبوت بطلب الكتاب كاملاً، أم فقط فقرة محددة؟

في عالم الذكاء الاصطناعي، يبني الباحثون غالباً هذه "الروبوتات الأمينة" لحل أسئلة معقدة. وعادة ما يقارنون بينها من خلال النظر إلى النتيجة النهائية: "هل حصل الروبوت على الإجابة الصحيحة؟". لفترة طويلة، تجاهل الجميع التفاصيل الفوضوية للمكتبة نفسها. قد يستخدم أحد الفرق مكتبة تكون فيها الكتب مقطعة إلى قطع من 100 كلمة، بينما يستخدم فريق آخر فصولاً كاملة. إذا فاز روبوت الفريق (أ)، فهل السبب هو أن الروبوت أكثر ذكاءً، أم لأن المكتبة كانت أسهل في التصفح؟ تأتي هذه الورقة البحثية لتقول: "مهلاً، علينا أن نتوقف عن التخمين ونبدأ في قياس المكتبة نفسها". يريد المؤلفون إنشاء ساحة لعب عادلة ومعيارية حيث يمكننا رؤية كيف يشكل البيئة سلوك الروبوت بدقة، بدلاً من مجرد لوم أو مدح عقل الروبوت.

هنا يبرز SimpleWikiSearch، وهو "مكتبة غير متصلة بالإنترنت" (offline library) جديدة ونظيفة للغاية، بُنيت خصيصاً لاختبار وكلاء الذكاء الاصطنا هذه. فكر في الأمر كنسخة رقمية منظمة تماماً من ويكيبيديا يمكن للروبوت استكشافها دون لمس الإنترنت الحقيقي أبداً. لم يكتفِ المؤلفون ببناء مكتبة، بل بنوا قواعد المكتبة. لقد أخذوا ويكيبيديا الإنجليزية بأكملها، ونظفوها، وقطّعوها إلى أجزاء منطقية؛ ليس كقصاصات صغيرة مكونة من 100 كلمة كما فعلت الأنظمة القديمة، بل إلى أقسام أكبر ومنطقية تحافظ على السياق، مثل فصل كامل أو جدول بيانات كامل.

يتفاعل الروبوت مع هذه المكتبة باستخدام ثلاث أدوات بسيطة، مثل مجموعة من العصي السحرية:

  1. البحث (Search): يمكن للروبوت طرح سؤال، فتعطيه المكتبة قائمة بـ "المقتطفات" الأكثر صلة مع الروابط.
  2. فتح الرابط (Open URL): إذا أعجب الروبوت مقتطف ما، يمكنه النقر على الرابط لقراءة القسم الكامل أو حتى المقال بأكمبله.
  3. تقديم الإجابة (Submit Answer): بمجرد أن يشعر الروبوت بالثقة، يقدم إجابته النهائية.

النتيجة الرئيسية للورقة هي أنه من خلال توحيد هذه البيئة، يمكننا أخيراً مقارنة نماذج الذكاء الاصطنا المختلفة بشكل عادل. اختبر المؤلفون هذا الإعداد مع عدة نماذج ذكاء اصطناعي مفتوحة المصدر (تحديداً إصدارات Qwen3.5 بـ 4 مليارات و9 مليارات معلمة) على ستة تحديات مختلفة للإجابة على الأسئلة. وجدوا أن العقول الأكبر (نموذج 9B) تؤدي بشكل عام بشكل أفضل، ولكن ليس دائماً في خط مستقيم؛ فأحياناً يحصل النموذج الأكبر على درجات أقل قليلاً في مهام محددة، مما يظهر أن "الأكبر" ليس حلاً سحرياً لكل شيء. كما قارنوا هذه النماذج مفتوحة المصدر مع بعض أقوى النماذج التجارية "الصندوق الأسود". ومن المثير للاهتمام أن النماذج التجارية غالباً ما حصلت على درجات "حكم" أعلى (بمعنى أن ذكاءً اصطناعياً يشبه البشر اعتبر إجاباتها صحيحة واقعياً حتى لو اختلف الصياغة)، بينما حصلت النماذج مفتوحة المصدر أحياناً على درجات "تطابق تام" أفضل.

الأمر الجوهري هو أن الورقة تكشف أن الطريقة التي يستخدم بها الروبوت المكتبة تهم بقدر أهمية الإجابة التي يقدمها. ومن خلال تتبع كل حركة قام بها الروبوت، اكتشف المؤلفون أن الأسئلة الأصعب (مثل تلك التي تتطلب خطوات متعددة من الاستنتاج) أجبرت الروبوتات على اتخاذ المزيد من "الجولات" من البحث والنقر. وفي التحديات الأكثر صعوبة، غالباً ما تنفد من الروبوتات الأوقات أو الأدوار قبل أن تتمكن من تقديم الإجابة، حتى لو كانوا قريبين منها. وهذا يشير إلى أن التحسينات المستقبلية لا ينبغي أن تركز فقط على جعل عقل الروبوت أذكى، بل أيضاً على مساعدته في التنقل داخل المكتبة بكفاءة أكبر.

المؤلفون واضحون جداً في أنهم لا يدعون أنهم اخترعوا خوارزمية روبوت جديدة فائقة الذكاء. بدلاً من ذلك، مساهمتهم هي البيئة نفسها. لقد قدموا "إطار عمل" (harness) قابلاً لإعادة الإنتاج والشفافية، حيث يمكن لأي شخص تشغيل نفس الاختبارات، ورؤية نفس النتائج تماماً، وفهم سبب نجاح أو فشل الروبوت بدقة. لقد أطلقوا أيضاً جميع البيانات، بما في ذلك عملية تفكير الروبوت وكل نقرة قام بها، لكي يتمكن المجتمع العلمي بأكمبله من دراسة السلوك. باختصار، SimpleWikiSearch هو الحكم الذي يضمن أخيراً أن الجميع يلعبون وفق القواعد ذاتها، مما يجعل من الممكن معرفة ما إذا كان الروبوت عبقرياً حقاً أم أنه مجرد محظوظ لأن المكتبة كانت سهلة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →