HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents
يُعد HyperEyes وكيل بحث متوازي متعدد الوسائط تم تدريبه عبر إطار تعزيز كفاءة ثنائي الحبيبات يدمج التأسيس البصري والاسترجاع في إجراءات متزامنة، محققاً دقة فائقة وتكاليف استدلال منخفضة بشكل كبير مقارنة بالوكلاء المتسلسلين الحاليين.
المؤلفون الأصليون: Guankai Li, Jiabin Chen, Yi Xu, Xichen Zhang, Yuan Lu
المؤلفون الأصليون: Guankai Li, Jiabin Chen, Yi Xu, Xichen Zhang, Yuan Lu
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: HyperEyes
بيان المشكلة
تعتمد وكلاء البحث متعدد الوسائط الحاليون بشكل أساسي على نموذج تسلسلي، حيث يعالجون الكيانات المستهدفة واحدًا تلو الآخر. ورغم فعالية هذا النهج في الاستدلال متعدد الخطوات (multi-hop reasoning)، إلا أنه يتسبب في تكرار تفاعلي شديد عندما تنقسم الاستعلامات بطبيعتها إلى عمليات استرجاع فرعية مستقلة (مثل تحديد كيانات متعددة في صورة واحدة). تعاني الوكلاء التقليدية من خطوط إنتاج "القص ثم البحث" (crop-then-search) حيث تؤدي أخطاء التحديد الموضعي المبكرة إلى إفساد النتائج اللاحقة، كما أن الطبيعة التسلسللية تجبر الاستعلامات متعددة الكيانات على جولات تفاعلية مطولة ومكررة. علاوة على ذلك، تُحسن نماذج التدريب الحالية دقة الإجابة النهائية بشكل أساسي، وتفتقر إلى الحوافز التي تفضل المسارات المتوازية المقتضبة على المسارات المطولة. ونتيجة لذلك، غالبًا ما تتحول القدرات المتوازية إلى بحث مفرط بالقوة الغاشمة، مما يؤدي إلى تضخم زمن الاستجابة واستهلاك الرموز (tokens) دون تحسين الدقة.
المنهجية
يقترح المؤلفون HyperEyes، وهو وكيل بحث متعدد الوسائط متوازي مصمم حول مبدأ "البحث بشكل أوسع، لا بشكل أطول". يقوم النظام بدمج التأسيس البصري (visual grounding) والاسترجاع في إجراء ذري واحد، مما يسمح بالبحث المتزامن عبر كيانات متعددة في جولة واحدة.
1. البحث الموحد المرتكز (Unified Grounded Search - UGS)
يعيد HyperEyes صياغة التأسيس البصري من كونه خطوة تمهيدية إلى كونه معلمة (parameter) لإجراء الاسترجاع. فبدلاً من عملية مكونة من مرحلتين (القص ثم البحث)، يتنبأ الوكيل في آن واحد بصناديق الإحاطة (bounding boxes) لجميع الكيانات المستهدفة ويرسل استعلامات بحث متوازية (صور ونصوص) ضمن جولة واحدة. وهذا يفصل بين تحديد الكيان وبين الاستدلال اللاحق.
2. مسار التدريب (Training Pipeline)
تتكون عملية التدريب من مرحلتين:
المرحلة 1: تركيب بيانات قابلة للتوازي وإشراف البداية الباردة (Cold-Start Supervision)
- تركيب البيانات: قام المؤلفون بتنسيق مجموعة بيانات تضم 271,000 مهمة تعتمد على الأدوات، تشمل 20,000 استعلام بصري متعدد الكيانات (تم تركيبها عبر تعزيز الموزاييك لمجموعات التصنيف دقيقة التفاصيل) و5,000 استعلام نصي متعدد القيود.
- أخذ العينات بالرفض التدريجي (Progressive Rejection Sampling - PRS): لتوليد مسارات عالية الجودة للضبط الدقيق تحت الإشراف (SFT)، استخدم المؤلفون خوارزمية PRS. تقوم هذه الخوارومة بأخذ عينات من المسارات عبر ميزانيات جولات متصاعدة، مع الاحتفاظ بصرامة فقط بأقصر مسار ناجح لكل استعلام. يعمل هذا على تصفية استدعاءات الأدوات المكررة وإعادة الصياغة التكرارية، مما يؤدي إلى تقطير 30,000 مسار للبداية الباردة موجه نحو الكفاءة.
المرحلة 2: التعلم التعزيزي (RL) مزداني الحبيبات والوعي بالكفاءة
لتحسين كل من الدقة والكفاءة، قدم المؤلفون إطار عمل RL ثنائي المستوى:- المستوى الكلي (TRACE): آلية مكافأة على مستوى المسار تسمى كفاءة التكلفة المتكيفة مع مرجع استخدام الأدوات (Tool-use Reference-Adaptive Cost Efficiency - TRACE). تستخدم عتبة مرجعية لعدد جولات استدعاء الأدوات (t^c) تضيق بشكل رتيب أثناء التدريب بناءً على أفضل النتائج في الدورات الحالية. هذا يخلق منهجًا ضمنيًا يمنع استدعاءات الأدوات غير الضرورية دون تقييد عمليات البحث الحقيقية متعددة الخطوات. تعاقب المكافأة المسارات التي تتجاوز المرجع أو تفشل في تلبية الدقة، بينما تكافئ تلك التي تقع ضمن الحدود الفعالة.
- المستوى الجزئي (OPD): لمعالجة نقص تخصيص الائتمان (credit-assignment) الناتج عن مكافآت النتيجة الشحيحة في المسارات الفاشلة، قام المؤلفون بتكييف التقطير في الوقت الفعلي (On-Policy Distillation - OPD). يوفر نموذج "معلم" أقوى (HyperEyes-235B) إشارات تصحيحية كثيفة على مستوى الرموز (token-level) حصريًا للنموذج "الطالب" (HyperEyes-30B) في المسارات الفاشلة. يتيح ذلك للطالب التعلم من خطوات الاستدلال الوسيطة الصالحة دون تحمل تكلفة الاستدلال الخاصة بالمعلم.
3. معيار التقييم (IMEB)
إدراكًا لأن المعايضات الحالية تقيم الدقة مع تجاهل الكفاءة، قدم المؤلفون معيار IMEB (معيار تعدد الكيانات الصوري). تتكون هذه المجموعة المنسقة بشريًا من 300 حالة تتطلب تحديدًا واسترجاعًا متزامنًا عبر كيانات متعددة. كما اقترحوا درجة الوعي بالتكلفة (Cost-Aware Score - CAS)، وهو مقي-س يقيس كميًا صحة الاستدلال وكفاءة البحث من خلال معاقبة استهلاك الرموز وجولات استدعاء الأدوات.
المساهمات الرئيسية
- وكيل HyperEyes: وكيل بحث متعدد الوسائط متوازٍ يعمل على مساحة إجراءات "البحث الموحد المرتكز"، محققًا كفاءة عالية من خلال تأسيس والبحث في كيانات متعددة في وقت واحد.
- إطار عمل RL مزداني الحبيبات: نهج تدريب مبتكر يجمع بين قيود الكفاءة التكيفية على المستوى الكلي (TRACE) والتقطير على مستوى الرمز على المستوى الجزئي (OPD) لتحسين سلوك البحث.
- معيار IMEB (الوعي بالكفاءة): أول معيار يقيم بشكل مشترك دقة الإجابة وكفاءة البحث في السيناريوهات البصرية متعددة الكيانات، مرفقًا بمقياس CAS.
- مسار تركيب البيانات: طريقة لتوليد بيانات تدريب قابلة للتوازي باستخدام أخذ العينات بالرفض التدريجي لتقطير مسارات خالية من التكرار.
النتائج التجريبية
تم تقييم HyperEyes على ستة معايضات للبحث متعدد الوسائط (MMSearch, FVQA, LiveVQA, BCVL, MMSearch+, و IMEB) باستخدام نماذج خلفية Qwen3-VL (بأحجام 30B و 235B).
- الدقة والكفاءة: يتفوق HyperEyes-30B (RL) على أقوى وكيل مفتوح المصدر من حيث الحجم (VDR) بنسبة 9.9% في الدقة بينما يتطلب 5.3 أضعاف أقل من جولات استدعاء الأدوات في المتوسط.
- الأداء الرائد (SOTA): يقترب Hyperelyes-235B (RL) من أداء نموذج Gemini-3.1-Pro المملوك، متفوقًا على الوكلاء التجاريين والمفتوحين الآخرين (مثل Claude-Opus-4.6 و Kimi-K2.5) في إعداد سير العمل الوكيلي (agentic workflow).
- درجة الوعي بالتكلفة (CAS): تحت مقياس CAS، يحقق HyperEyes-30B درجة أعلى بـ 4.3 أضعاف من ثاني أفضل منافس مفتوح المصدر في المعايضات المعقدة متعددة الخطوات، وأعلى بـ 7.6 أضعاف في معيار IMEB متعدد الكيانات.
- دراسات الاستئصال (Ablation Studies): تؤكد التجارب أن التصفية الصارمة للجودة (تقليل حجم البيانات بنسبة 75%) تحسن الدقة بشكل كبير مقارنة بحجم البيانات الخام. علاوة على ذلك، فإن مكافأة TRACE التكيفية والمعلم المتوافق مع الكفاءة لـ OPD ضروريان لتقليل تكرار استدعاء الأدوات وتعزيز الدقة.
الأهمية والادعاءات
يزعم البحث أن HyperEyes يضع معيارًا جديدًا لوكلاء البحث مفتوحي المصدر، موضحًا أن الدقة والكفاءة التشغيلية هما هدفان متكاملان وليسا متضاربين في البحث متعدد الوسائط الوكيلي. من خلال الانتقال من البحث التسلسلي "البحث الأطول" إلى البحث المتوازي "البحث الأوسع"، يلغي الإطار التكرار وتراكم الضجيج المتأصل في خطوط إنتاج "القص ثم البحث" التقليدية. يؤكد المؤلفون أن عملهم يوفر أساسًا قابلًا لإعادة الإنتاج لبناء مساعدين متعددي الوسائط أكفاء، لا سيما في المجالات التي تكون فيها الإجابات الموثقة والمستندة إلى المصادر ضرورية. يهدف إصدار IMEB ومسار التدريب إلى خفض حواجز الدخول للبحث في الوكلاء متعددي الوسائط الواعين بالكفاءة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.
تصلك أفضل أبحاث machine learning كل أسبوع.
يحظى بثقة باحثين في ستانفورد وكامبريدج والأكاديمية الفرنسية للعلوم.
تفقّد بريدك لتأكيد الاشتراك.
حدث خطأ ما. تعيد المحاولة؟
لا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.