ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization
تقدم الورقة البحثية ReSum، وهو إطار عمل يعمل دون الحاجة إلى تدريب وقابل للتوصيل والتشغيل المباشر، يُمكّن الوكلاء الويب القائمين على النماذج اللغوية الكبيرة من التغلب على قيود نافذة السياق من خلال التلخيص الدوري للسجل، والذي يتم تعزيزه بشكل أكبر بواسطة ReSum-GRPO لتحسين تخصيص الائتمان طويل الأمد عبر بث الميزة.
تخيل أنك محقق تحاول حل لغز معقد للغاية. تمتلك عقلاً عبقرياً (الذكاء الاصطناعي)، ولكن ليس لديك سوى مفكرة صغيرة لتدوين ملاحظاتك، وأفكارك، ومقابلاتك.
المشكلة: حد "المفكرة" في عالم الذكاء الاصطناعي، تسمى هذه المفكرة "نافذة السياق" (Context Window).
الطريقة القديمة (ReAct): يكتب المحقق كل فكرة، وكل سؤال يطرحه، وكل إجابة يحصل عليها. إذا كان اللغز بسيطاً، فالمفكرة ستكون كافية. ولكن إذا كان اللغز ضخماً (مثل البحث عن شخص معين بناءً على شجرة عائلة متشابكة وحقائق غامضة)، فإن المفكرة ستمتلئ فوراً. يصل المحقق إلى حافة الصفحة، فيضطر للتوقف، وينسى كل ما كتبه سابقاً. لا يمكنه حل القضية لأنه نفد من المساحة.
"الحلول" الحالية: يحاول بعض الباحثين بناء مفكرة أكبر أو منح المحقق غرسة ذاكرة سحرية. لكن هذا مكلف، ويتطلب إعادة بناء المحقق من الصفر، ولا يعمل مع المحققين الموجودين لدينا بالفعل.
الحل: ReSum (الملخص الذكي) تقدم الورقة البحثية ReSum، وهو يشبه توظيف محرر بارع لمساعدة المحقق الخاص بك.
كيف يعمل: بدلاً من ترك المفكرة تمتلئ، يتدخل المحرر بشكل دوري. يقرأ ملاحظات المحقق الفوضوية والطويلة ويقول: "حسناً، إليكم أهم 5 أدلة وجدناها حتى الآن. لنرمِ بقية الملاحظات ونبدأ صفحة جديدة بهذه الأدلة الخمسة فقط."
السحر: الآن يمكن للمحقق الاستمرار للأبد! فهو لن ينفد من المساحة أبداً لأن المحرر يستمر في تكثيف التاريخ إلى ملخص صغير وقوي. الأمر يشبه لعب لعبة فيديو حيث تقوم بحفظ تقدمك في ملف صغير، ثم تحمل ذلك الملف لتكمل رحلتك دون الحاجة لإعادة لعب اللعبة بأكملها.
الأداة: ReSumTool-30B لجعل هذا يعمل، أنت بحاجة إلى محرر جيد حقاً. قد يقوم ذكاء اصطناعي عام بتلخيص الأشياء بشكل سيء، مما يؤدي لفقدان الأدلة الحاسمة. لذلك قام المؤلفون بتدريب ذكاء اصطناعي خاص (ReSumTool-30B) ليكون هذا المحرر تحديداً. إنه يشبه تدريب أمين مكتبة يعرف تماماً كيف يحول رواية من 500 صفحة إلى ورقة غش من صفحة واحدة لا تزال تحكي القصة بأكملها.
التدريب: ReSum-GRPO (تعليم المحقق الثقة في المحرر) هذا هو الجزء الصعب؛ فالمحقق معتاد على رؤية كل شيء. عندما تعطيه فجأة ملخصاً بدلاً من التاريخ الكامل، قد يصاب بالارتباك أو يرتكب أخطاءً لأنه ليس معتاداً على ذلك.
الحل: استخدم المؤلفون طريقة تدريب خاصة تسمى ReSum-GRPO. فكر في هذا كمدرب يراقب المحقق وهو يحل اللغز.
إذا حل المحقق القضية، يمنحه المدرب مكافأة.
لكن الجزء الذكي هو أن المدرب لا يكافئ نهاية اللعبة فحسب. بل ينظر إلى الرحلة بأكملها. يقول: "عمل رائع في البداية عندما وجدت ذلك الدليل، رغم أننا لخصناه لاحقاً!"
هذا يعلم المحقق أن التلخيص أمر جيد وأنه يمكنه الثقة في ملاحظات المحرر لتوجيهه نحو الحل.
لماذا يهم هذا؟
لا حاجة لإعادة البناء: لا تحتاج إلى إعادة بناء المحقق الخاص بك (الذكاء الاصطناعي). يمكنك فقط توصيل أداة "المحرر" هذه، وستعمل فوراً.
يحل الألغاز الأصعب: يسمح للذكاء الاصطناعي بمعالجة الأسئلة التي تتطلب البحث عبر مئات صفحات الويب، وهو أمر كان مستحيلاً سابقاً لأن الذكاء الاصطناعي كان ينسى بداية البحث بحلول الوقت الذي يصل فيه إلى نهايته.
رخيص وفعال: يحقق نتائج مقاربة لنماذج الذكاء الاصطناعي الضخمة والمكلفة، ولكنه يستخدم قدرة حوسبية أقل بكثير.
باختصار ReSum يشبه إعطاء الذكاء الاصطناعي ممحاة سحرية وقلم تحديد (هايلايتر). إنه يسمح للذكاء الاصطناعي بالعمل على أصعب المشكلات وأطولها من خلال مسح التفاصيل المملة باستمرار مع الإبقاء على أهم الحقائق محددة، مما يسمح له بالتفكير للأبد دون أن يشعر بالارتباك أو الغرق في التفاصيل.
إليك ملخص تقني مفصل لورقة البحث بعنوان "ReSum: فتح آفاق ذكاء البحث طويل الأمد عبر تلخيص السياق".
1. بيان المشكلة
تتفوق وكلاء الويب (Web Agents) القائمة على النماذج اللغوية الكبيرة (LLMs) في المهام كثيفة المعرفة، لكنها تواجه صراعاً جوهرياً: الحاجة إلى استكشاف واسع وطويل الأمد مقابل نوافذ السياق المحدودة للنماذج الحالية.
عنق الزجاجة: يتبع نموذج ReAct (التفكير + الفعل) القياسي نهج إلحاق كل فكرة، وفعل، وملاحظة بسجل السياق. بالنسبة للاستعلامات المعقدة التي تتطلب دورات بحث متعددة، يؤدي هذا سريعاً إلى استنفاد ميزانية الرموز (Tokens) (مثل 32 ألف رمز)، مما يجبر الوكيل على قطع السجل أو الفشل قبل العثور على الإجابة.
قصور الحلول الحالية: تعتمد الأساليب الحالية مثل MEM1 أو MemAgent على تعديلات معمارية (مثل رموز الذاكرة الداخلية) التي تكسر التوافق مع الوكلاء المدربين مسبقاً وتتطلب إعادة تدريب مكلفة وشاملة.
2. المنهجية
يقترح المؤلفون ReSum، وهو نموذج "plug-and-play" (جاهز للاستخدام المباشر) خفيف الوزن، و ReSum-GRPO، وهو خوارزمية تعلم تعزيزي لتكييف الوكلاء مع هذا النموذج الجديد.
أ. نموذج ReSum
يسمح ReSum بالاستكشاف غير المحدود عن طريق ضغط سجل التفاعل دورياً إلى ملخص مكثف.
الآلية:
التفاعل القياسي: يعمل الوكيل بشكل طبيعي (تفكير ← فعل ← ملاحظة).
المُحفز: عندما يقترب السياق من حد الرموز (محفز منهجي)، يتم استدعاء أداة التلخيص (πsum).
الضغط: تقوم الأداة بتكثيف التاريخ الكامل (Ht) إلى ملخص موجه نحو الهدف (s).
إعادة الضبط: يتم إعادة ضبط التاريخ إلى حالة مضغوطة Ht′=(q,s)، حيث q هو الاستعلام الأصلي و s هو الملخص. يستأنف الوكيل التفكير من هذه الحالة المضغوطة.
الفائدة: يسمح هذا للوكيل بالحفاظ على الوعي بالاكتشافات السابقة مع توفير مساحة سياقية لاستكشاف غير محدود دون تغييرات معمارية.
ب. ReSumTool-30B (نموذج تلخيص متخصص)
تعاني النماذج اللغوية الكبيرة العامة من صعوبة في التمييز بين الأدلة الرئيسية والضجيج في السجلات الطويلة. طور المؤلفون ReSumTool-30B لمعالجة ذلك:
المعمارية: يعتمد على Qwen3-30B-A3B-Thinking.
التدريب: تم استخلاصه (Distilled) من نموذج معلم قوي (GPT-OSS-120B) باستخدام مجموعة بيانات تضم أكثر من 9,000 زوج عالي الجودة من ⟨محادثة، ملخص⟩ مستمدة من معيار SailorFog-QA.
القدرات: مدرب خصيصاً لاستخراج الأدلة القابلة للتحقق، وتحديد الفجوات المعلوماتية، واقتراح الخطوات القابلة للتنفيذ، متفوقاً على نماذج أكبر بكثير (مثل DeepSeek-R1-671B) في جودة التلخيص لسياقات البحث عبر الويب.
ج. ReSum-GRPO (تكييف النموذج عبر التعلم التعزيزي)
بينما يعمل ReSum بدون تدريب، إلا أن الوكلاء القياسيين ليسوا متوافقين بطبيعتهم مع التفكير بناءً على السياقات المضغوطة. قدم المؤلفون ReSum-GRPO (تحسين السياسة النسبي للمجموعات) لتحسين الوكلاء لهذا النموذج.
تقسيم المسار: يتم تقسيم المسارات الطويلة عند نقاط التلخيص إلى حلقات متعددة (H(1),H(2),…).
بث الميزة (Advantage Broadcasting):
بدلاً من تصميم مكافآت لكل جزء، يتم حساب مكافأة موحدة على مستوى المسار بناءً على صحة الإجابة النهائية (R∈{0,1}).
يتم تطبيع هذه المكافأة ضمن مجموعة من عمليات التشغيل لحساب الميزة (A^).
والأهم من ذلك، يتم بث هذه الميزة إلى جميع الأجزاء داخل المسار.
الهدف: تحل هذه الآلية مشكلة تخصيص الائتمان (Credit Assignment) في المهام طويلة الأمد، مما يشجع الوكلاء على التفكير بفعالية من الحالات المضغوطة وجمع المعلومات التي تؤدي إلى ملخصات عالية الجودة.
3. المساهمات الرئيسية
نموذج ReSum: حل "plug-and-play" يفصل إدارة السياق عن معمارية الوكيل، مما يتيح استكشافاً غير محدود دون إعادة تدريب أو تغييرات معمارية.
ReSumTool-30B: نموذج تلخيص متخصص وفعال يتفوق على النماذج الأكبر بكثير في استخراج الأدلة الرئيسية وتوجيه خطوات البحث.
ReSum-GRPO: خوارزمية تعلم تعزيزي مبتكرة تكيف الوكلاء مع التفكير القائم على التلخيص عبر تقسيم المسار وبث الميزة، وتتطلب 1K عينة تدريب فقط لتحقيق مكاسب كبيرة.
4. النتائج التجريبية
أُجريت التجارب على ثلاثة معايير تحدي: GAIA، و BrowseComp، و BrowseComp-zh.
الأداء بدون تدريب:
حقق ReSum (باستخدام ReSumTool-30B) تحسناً متوسطاً بنسبة 4.5% مقارنة بنموذج ReAct القياسي.
تفوق على MEM1 في الإعدادات التي لا تتطلب تدريباً، حيث غالباً ما تراجع أداء MEM1 بسبب عدم التوافق.
حقق وكيل 30B معزز بـ ReSum نسبة 16.0% Pass@1 على BrowseComp، متفوقاً على نماذج مملوكة مثل Claude-4 (12.2%) و Kimi-K2 (14.1%).
الأداء الذي يتطلب التدريب (ReSum-GRPO):
باستخدام 1K عينة تدريب فقط، حقق ReSum-GRPO زيادة إضافية بنسبة 8.2% فوق خط الأساس ReSum (بدون تدريب).
حقق WebSailor-30B مع ReSum-GRPO نسبة 33.3% Pass@1 على BrowseComp-zh، منافساً نماذج مفتوحة المصدر تم تدريبها على أكثر من 10K عينة (مثل ASearcher-32B بنسبة 15.6%).
الكفاءة: حقق ReSum-GRPO أداءً مماثلاً أو أفضل من MEM1-GRPO مع استهلاك رموز أقل بنحو 3 أضعاف، مما يوفر مقايضة أفضل بين الأداء والكفاءة.
5. الأهمية والأثر
القابلية للتوسع: يثبت ReSum أنه حتى الوكلاء ذوو نوافذ السياق الكبيرة (مثل 128k) يستفيدون من التلخيص، حيث أن مهام البحث عن المعلومات المعقدة غالباً ما تتجاوز حدود السياق الحالية.
فعالية التكلفة: يوفر مساراً لوكلاء عالي الأداء دون التكلفة الحسابية الهائلة لتدريب معماريات جديدة أو عدم كفاءة البيانات في جمع مسارات الخبراء للضبط الدقيق تحت الإشراف.
القدرة على التعميم: كنموذج "plug-and-play"، يمكن تطبيقه على الوكلاء الحاليين الجاهزين فوراً، مما يجعله حلاً عملياً لنشر وكلاء ويب أقوياء للمهام طويلة الأمد في سيناريوهات العالم الحقيقي.
ختاماً، يحل ReSum مشكلة اختناق السياق في وكلاء الويب من خلال التلخيص الذكي والتكيف القائم على التعلم التعزيزي، مبرهناً على أن البحث الفعال طويل الأمد لا يتطلب إعادة تدريب ضخمة للنماذج أو تغييرات جذرية في المعمارية.