HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering
يقدم HierDoc إطار عمل هرمي لتوجيه الأدلة يتكون من مرحلتين، يعمل على تحسين اختيار الصفحات واستخراج المناطق بشكل متسلسل باستخدام تقنية GRPO المرحلية مع مكافآت المجموعات المهيكلة، محققاً أداءً هو الأفضل في فئته في مجال الإجابة على الأسئلة المرئية للوثائق الطويلة عبر سد الفجوة بفعالية بين الاستحواذ العام على الصفحات والتحديد الدقيق للمناطق.
المؤلفون الأصليون:Rongjian Gu, Wengang Zhou, Junyu Xiong, Yonghui Wang, Bing Yin, Bei Wang, Houqiang Li
تخيل أنك تحاول حل لغز ما، ولكن بدلاً من الحصول على دليل واحد، وُضعت بين يديك كومة من مائة كتاب سميك ومليء بالرسومات التوضيحية. الإجابة على سؤالك مخبأة في مكان ما هناك—ربما في رسم تخطيطي صغير في الصفحة 42، أو جملة محددة في جدول في الصفحة 89. هذا هو عالم الإجابة على الأسئلة المرئية للمستندات (Document Visual Question Answering). إنه فرع من فروع الذكاء الاصطناعي حيث تحاول الحواسيب قراءة وفهم المستندات المليئة بالصور والمخططات والنصوص المختلطة معاً. لفترة طويلة، كانت هذه "القارئات" الحاسوبية تشبه الطلاب الذين لا يستطيعون سوى النظر إلى صفحة واحدة في كل مرة، أو أنها كانت تحاول قراءة كومة الكتب بأكملها دفعة واحدة، مما يؤدي إلى شعورها بالارتباك وفقدان التفاصيل الدقيقة. التحدي الكبير يكمن في معرفة كيفية العثور على الصفحة الصحيحة تماماً ثم التكبير على البقعة الصحيحة تماماً دون الضياع في وسط الضجيج.
الآن، تعرف على HierDoc، وهو أسلوب جديد يعمل كـ "محقق ذكي ذو خطوتين" لهذه الكومات الضخمة من المستندات. في السابق، كانت معظم الأنظمة الحاسوبية تشبه شخصاً إما يمسك بكتاب كامل آملاً أن تكون الإجابة بداخله، أو شخصاً عُرضت عليه صفحة محددة وطُلب منه البحث عن إبرة في كومة قش. نادراً ما كان بإمكانهم القيام بالخطوتين معاً بشكل جيد. يغير HierDoc قواعد اللعبة عبر تقسيم المهمة إلى مهمتين متميزتين ومتخصصتين. أولاً، يعمل "سياسة الصفحة" (Page Policy) ككشاف، حيث يمسح المستند بالكامل بسرعة لاختيار الصفحات التي من المرجح أن تحتوي على الإجابة فقط. إنه يشبه أمين مكتبة يعرف بالضبط الكتب الثلاثة التي يجب سحبها من الرف، متجاهلاً الكتب الأخرى السبعة والتسعين.
بمجرد اختيار الصفحات الصحيحة، يتولى "سياسة المنطقة" (Region Policy) المهمة. هذا الجزء يشبه محققاً يحمل عدسة مكبرة، ينظر إلى تلك الصفحات المحددة ويجد الفقرة أو المخطط أو خلية الجدول التي تحتوي على الدليل. إنه يتجاهل بقية الصفحة، ويركز فقط على "المنطقة" ذات الصلة. تظهر الورقة البحثية أنه من خلال معاملة هاتين الخطوتين كخطوتين منفصلتين ومحسنتين، يصبح النظام أفضل بكثير في العثور على الإجابات. في الاختبارات على الألغاز الصعبة ذات المستندات الطويلة، حسّن هذا النهج المكون من خطوتين الدقة بفارق كبير—تحديداً، فقد عزز الأداء بنسبة 16.87% في أحد الاختبارات الرئيسية مقارنة بأفضل الأنظمة المفتوحة السابقة. والأكثر إثارة للاهتمام، وجد الباحثون أن إضافة بحث "المنطقة" دقيق التفاصيل هذا فوق مجرد اختيار الصفحات جعل النظام أكثر دقة بنسبة 5.51% وأفضل بنسبة 4.82% في العثات على الأدلة الصحيحة (مقاساً بمقياس F1).
السر ليس فقط في أنه ينظر إلى أشياء أكثر؛ بل في كيفية تعلمه تجاهل الأشياء الخاطئة. يستخدم النظام طريقة تدريب تسمى GREO (تحسين السياسة النسبي للمجموعات - Group Relative Policy Optimization)، وهي تشبه مدرباً يقدم ملاحظات للفريق. بدلاً من مجرد قول "عمل جيد" أو "عمل سيء"، يقوم المدرب بمقارنة المحاولات المختلفة جنباً إلى جنب. إذا اختار النظام صفحات كثيرة جداً، فإنه يتعرض لعقوبة. وإذا فاته الدليل الصحيح، فإنه يتعرض لعقوبة أيضاً. إنه يتعلم موازنة الشمولية مع الدقة. تجادل الورقة البحثية صراحة ضد فكرة أنك بحاجة لتغذية الكمبيوتر بالمستند بأكمله أو أنه يمكنك الاعتماد فقط على نموذج واحد ضخم للقيام بكل شيء في آن واحد. بدلاً من ذلك، أثبتوا أن تقسيم المشكلة إلى "البحث عن الصفحة" ثم "البحث عن البقعة" يعمل بشكل أفضل بكثير.
ومع ذلك، يحرص المؤلفون على الإشارة إلى أن هذا ليس حلاً سحرياً يحل كل شيء بشكل مثالي. نظرًا لأن النظام يعمل في خطوات، فإذا أخطأت الخطوة الأولى (سياسة الصفحة) في اختيار الصفحة الصحيحة تماماً، فلن تتمكن الخطوة الثانية من إصلاح ذلك؛ إذ يضيع الدليل للأبد. كما يعتمد النظام على محلل (أداة تسمى MinerU) لتقسيم الصفحات إلى مناطق، لذا إذا ارتكب هذا المحلل خطأً أو كان النص غير منظم، فإن خيارات النظام ستكون محدودة. ولكن في الوقت الحالي، يظهر HierDoc أن تنظيم عملية البحث الحاسوبي في مسار هرمي واضح—من الصورة الكبيرة وصولاً إلى التفاصيل الدقيقة—هو وسيلة قوية لمساعدة الآلات على قراءة المستندات الطويلة والمعقدة.
ملخص تقني: HierDoc
بيان المشكلة تتطور عملية الإجابة على الأسئلة المرئية للوثائق (DocVQA) متعددة الصفحات من مجرد قراءة صفحة واحدة إلى الاستدلال في الوثائق الطويلة، حيث غالبًا ما تكون أدلة الإجابة مبعثرة وموزعة عبر صفحات وعناصر مرئية متعددة. تتبع المنهجيات الحالية عادةً مستوى واحد فقط من التفصيل:
المنهجيات المتمحورة حول الصفحة (Page-centric): تركز على استرجاع الصفحات ذات الصلة ولكنها تعامل العمليات على مستوى المنطقة (region-level) كمجرد أدوات ملاحة، فتفشل في صياغة اختيار الأدلة كعملية دقيقة ومُحسّنة ومستقلة.
المنهجيات المتمحورة حول المنطقة (Region-centric): تفترض أن الصفحات ذات الصلة قد تم توفيرها بالفعل، متجاهلة المهمة الجوهرية المتمثلة في الحصول على الصفحات في مرحلة سابقة. وبناءً على ذلك، يظل اختيار الصفحات والمناطق منفصلين بدلاً من كونهما مرحلتين متتاليتين ومُحسّنتين لعملية موحدة للحصول على الأدلة.
المنهجية: إطار عمل HierDoc يقترح HierDoc إطار عمل هرمي لتوجيه الأدلة (hierarchical evidence-routing framework) يقوم بنمذجة عملية الحصول على الأدلة في الوثائق الطويلة كمسألة تنبؤ بمجموعات (set prediction) على مرحلتين: من الصفحات إلى المناطق. يعمل النظام عبر ثلاث مراحل متميزة:
توجيه الصفحات (سياسة الصفحة - Page Policy):
بالنظر إلى سؤال ووثيقة مُصيرة (rendered)، تقوم سياسة صفحة قابلة للتدريب باختيار مجموعة مهيكلة من صفحات الأدلة.
للتعامل مع وثائق أطول من سياق مرئي واحد، يتم تقسيم الوثيقة إلى نوافذ غير متداخلة. تعمل السياسة بشكل مستقل على كل نافذة، وتُدمج النتائج لاحقًا.
يتم تفعيل آلية التفكير المحدود (bounded reflection) إذا تجاوز الاختيار الأولي حداً معيناً، مما يسمح للسياسة بتقليص الصفحات الزائدة دون الحاجة إلى هدف تدريب منفصل.
يتم تحسين السياسة باستخدام تحسين السياسة النسبي للمجموعات (GRPO) مع مكافأة المجموعة المهيكلة التي توازن بين تغطية الأدلة (Recall/F1) وحجم السياق، وتفرض عقوبات على الإجراءات غير الصالحة.
التحليل الدلالي وتوجيه المناطق (سياسة المنطقة - Region Policy):
يتم تحليل الصفحات المختارة بواسطة MinerU2.5-Pro إلى مناطق دلالية مرشحة (فقرات، جداول، رسوم بيانية، إلخ)، حيث يتم تخصيص اسم مستعار (alias) منفصل، وصندوق إحاطة (bounding box)، ونص (OCR/جدول) لكل منطقة. وهذا يخلق مساحة إجراءات منفصلة متوافقة مع المحلل (parser-native).
تعتمد سياسة المنطقة على السؤال، وصور الصفحات المختارة (مع تراكب الأسماء المستعارة)، والقائمة المرشحة لإنتاج مجموعة مهيكلة من معرفات مناطق الأدلة (evidence-region IDs).
على غرار توجيه الصفحات، تقوم آلية التفكير بتنقيح مجموعة المناطق للوصول إلى أصغر مجموعة كافية.
يتم تحسين سياسة المنطقة أيضاً عبر GRPO مع مكافآت محددة حسب مستوى التفصيل توازن بين الاستدعاء (recall)، والدقة (precision)، وF1، مع فرض عقوبات على الإجراءات الزائدة والأسماء المستعارة غير الصالحة.
الإجابة المستندة إلى الأدلة (Grounded Answering):
يتلقى نموذج إجابة منفصل الصفحات الكاملة المختارة (مع الحفاظ على التخطيط العام والعلاقات بين العناصر) جنباً إلى جنب مع قصاصات المناطق المختارة والبيانات النصية المرتبطة بها (نص OCR/الجدول).
يحافظ هذا التصميم على السياق العالمي مع التركيز على الأدلة المحلية الدقيقة. إذا لم يتم اختيار أي مناطق، يعمل النموذج على الصفحات الكاملة وحدها.
المساهمات الرئيسية
صياغة هرمية موحدة: يعد HierDoc أول إطار عمل يمثل الحصول على الصفحات والمناطق الدلالية كسياسات مجموعات مهيكلة متتالية ومستقلة عن الإجابة. وهذا يجعل قرارات التوجيه صريحة وقابلة للتحليل بشكل مستقل.
استراتيجية تدريب مرحلية: طور المؤلفون استراتيجية تدريب باستخدام GRPO لكل مرحلة مع مكافآت مجموعات خاصة بكل مستوى تفصيل. والأهم من ذلك، أنهم ربطوا الإشراف المكاني (صناديق الإحاطة) بمساحة إجراءات دلالية منفصلة (الأسماء المستعارة المتوافقة مع المحلل)، مما مكن من التعلم الفعال لاختيار المناطق.
تقييم شامل: تم تقييم إطار العمل عبر خمسة اختبارات معيارية (benchmarks) للأسئلة والأجوبة في الوثائق متعددة الصفحات والطويلة. تتضمن الدراسة تجارب استبعاد (ablations) للتحكم في التوجيه وتكوين الأدلة لعزل قيمة كل مكون.
النتائج التجريبية
الأداء: يحقق HierDoc أداءً رائداً أو تنافسياً بين الأنظمة مفتوحة الأوزان. في LongDocURL، حقق تحسناً في الدقة النسبية بنسبة 16.87% مقارنة بأقوى خط أساس (baseline) مفتوح الأوزان مسجل. وفي MMLongBench-Doc، حقق تحسناً بنسبة 27.36% مقارنة بالخط الأساسي (Doc-V*).
جودة الاسترجاع: تفوقت سياسة الصفحة بشكل كبير على مكونات اختيار الصفحات الموجودة، حيث حسنت F1 للصفحات بنسبة 38.63% في MMLongBench-Doc وبنسبة 56.76% في LongDocURL، مع بناء مجموعات أدلة أكثر إيجازاً (عدد أقل من الصفحات المختارة في المتوسط).
رؤى الاستبعاد (Ablation Insights):
التدريب: أدى تدريب GRPO لسياسة الصفحة إلى تحسين دقة الإجابة النهائية بنسبة 5.26% وتحسين F1 بنسبة 4.40% مقارنة بالنموذج الأساسي غير المدرب.
توجيه المناطق: أدى إضافة توجيه المناطق المدرب إلى نظام يعتمد على الصفحات فقط إلى تحسين دقة الإجابة بنسبة 5.51% وتحسين F1 بنسبة 4.82%.
تكوين الأدلة: يؤدي الجمع بين قصاصات المناطق المختارة ونصوص OCR المستخرجة إلى أفضل النتائج. ومع ذلك، فإن إزالة الصفحات الكاملة والاعتماد فقط على القصاصات والنصوص يقلل من الأداء، مما يؤكد أن سياق الصفحة العالمي وأدلة المنطقة الدقيقة يكملان بعضهما البعض.
الأهمية والقيود يدعي البحث أن تنظيم توجيه الصفحات العام وتوجيه المناطق الدقيق كمراحل متتالية ومُحسّنة بشكل منفصل يعالج بفعالية تحدي ندرة الأدلة في الوثائق الطويلة. وتظهر النتائج أن سياسات التوجيه الصريحة والمستقلة عن الإجابة يمكن أن تعزز بشكل كبير تحديد موقع الأدلة ودقة الإجابة النهائية.
يقر المؤلفون بعدة قيود:
انتشار الخطأ (Error Propagation): التصميم الهرمي غير قابل للعكس؛ فالأدلة التي تُستبعد أثناء توجيه الصفحات لا يمكن استعادتها في مرحلة المنطقة.
التبعية (Dependency): يعتمد توجيه المناطق على MinerU للتحليل؛ وبالتالي، فإن أخطاء تحليل التخطيط (layout-parsing)، وضجيج الـ OCR، وقيود المحاذاة الاستدلالية يمكن أن تحد من مساحة الإجراءات.
فجوة التحسين (Optimization Gap): يتم تحسين السياسات باستخدام أهداف على مستوى المجموعة بدلاً من التغذية الراجعة النهائية للإجابة، مما يعني أن التحسينات في مقاييس الاختيار قد لا تترجم دائماً بشكل متناسب إلى جودة الإجابة.
يشمل العمل المستقبلي الذي اقترحه المؤلفون دمج الاستعادة الواعية بعدم اليقين (uncertainty-aware recovery)، والتحسين المشترك للحصول على الأدلة مع الإجابة، وتقييم المقايضات عبر نطاقات وثائق أوسع.