← أحدث الأبحاث
💬 NLP

LiveWeb-IE: A Benchmark For Online Web Information Extraction

تقدم هذه الورقة LiveWeb-IE، وهو معيار مرجعي جديد لتقييم استخراج المعلومات من الويب على المواقع الإلكترونية الحية والمتطورة، وتقترح Visual Grounding Scraper (VGS)، وهو إطار عمل وكيل متعدد المراحل يحاكي الإدراك البصري البشري لاستخراج البيانات بمتانة من صفحات الويب الديناميكية.

المؤلفون الأصليون: Seungbin Yang, Jihwan Kim, Jaemin Choi, Dongjin Kim, Soyoung Yang, ChaeHun Park, Jaegul Choo

نُشر 2026-03-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Seungbin Yang, Jihwan Kim, Jaemin Choi, Dongjin Kim, Soyoung Yang, ChaeHun Park, Jaegul Choo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

🌐 المشكلة: "الصورة المجمدة" مقابل "البث المباشر"

تخيل أنك تحاول تعليم روبوت كيفية العثور على أشياء محددة في مكتبة.

الطريقة القديمة (المعايير المرجعية غير المتصلة - Offline Benchmarks):
في السابق، كان الباحثون يعلمون الروبوتات باستخدام صورة فوتوغرافية مجمدة لرف مكتبة تم التقاطها قبل خمس سنوات. كانوا يسألون الروبوت: "جد الكتاب الأحمر على الرف الثاني". تعلم الروبوت القواعد بدقة بناءً على تلك الصورة.

  • العقبة: في العالم الحقيقي، المكتبات فوضوية ومتغيرة باستمرار. الكتب تُنقل، والرفوف تُعاد ترتيبها، وتصل كتب جديدة. إذا أخذت نفس الروبوت إلى مكتبة حقيقية وحية اليوم، فسيصاب بالارتباك لأن "الكتاب الأحمر" قد يكون الآن على الرف الرابع، أو قد يبدو الرف مختلفاً تماماً. يفشل الروبوت لأنه تدرب على لقطة ثابتة، وليس على الواقع الحي والمتنفس.

الحل الجديد (LIVEWEB-IE):
تقدم هذه الورقة البحثية LIVEWEB-IE، وهو "ساحة تدريب" جديدة حيث يجب على الروبوتات العث صورة معلومات على مواقع ويب حية في الوقت الحالي. الأمر يشبه نقل الاختبار من صورة فوتوغرافية إلى بث فيديو مباشر. يجب على الروبوت التنقل في موقع ويب قد يكون قد غير تصميمه منذ بدء الاختبار.

🕵️‍♂️ الطريقة الجديدة: VGS (المحقق البصري)

قام المؤلفون أيضاً ببناء "دماغ روبوت" جديد يسمى VGS (كاشط التأسيس البصري - Visual Grounding Scraper). لفهم كيفية عمله، دعونا نقارنه بكيفية بحث الإنسان عن شيء محدد في غرفة فوضوية.

الروبوت القديم (المعتمد على HTML فقط):
حاولت الطرق القديمة قراءة موقع الويب كأنه دليل تعليمات ضخم ومربك مكتوب بلغة برمجية (HTML).

  • التشبيه: تخيل أنك تحاول العث/ التعرف على وجه صديقك في حشد من الناس عن طريق قراءة قائمة من 50 صفحة تتضمن طول كل شخص، ووزنه، ومقاس حذائه. هذا الأمر بطيء، ومربك، وإذا قام شخص واحد بتغيير قميصه، تصبح القائمة عديمة الفائدة.

روبوت VGS (التأسيس البصري - Visual Grounding):
يحاكي VGS الطريقة التي يبحث بها الإنسان فعلياً عن شيء ما. إنه يستخدم عملية تحقيق من أربع خطوات:

  1. السؤال (تحديد الخصائص):

    • الإنسان: "أنا أحتاج صورة القطة."
    • VGS: يقوم بتفكيك الطلب. "حسناً، أنا أبحث عن صورة لقطة."
  2. المسح (التأسيس البصري):

    • الإنسان: بدلاً من قراءة الغرفة بأكملها، يلقي نظرة سريعة ويقول: "القطة بالتأكيد في غرفة المعيشة، وليس في المطبخ."
    • VGS: ينظر إلى لقطة الشاشة (Screenshot) لصفحة الويب ويتجاهل الكود البرمجي. إنه يجد المنطقة (Region) المحددة حيث يُحتمل وجود صورة القطة. إنه يتجاهل بقية الضجيج الموجود في الصفحة.
  3. التحديد الدقيق (تحديد العنصر):

    • الإنسان: الآن بما أنك في غرفة المعيشة، فأنت تقترب أكثر. "آه، ها هي! إنها الصورة الموجودة على طاولة القهوة، وليست تلك الموجودة على الحائط."
    • VGS: يضع "هدفاً" صغيراً حول الصورة الدقيقة التي يحتاجها، متجاهلاً الصور الأخرى القريبة.
  4. الخريطة (توليد مسار XPath):

    • الإنسان: ترسم خريطة لصديقك الروبوت: "اذهب إلى غرفة المعيشة، وانظر إلى طاولة القهوة، ثم خذ الصورة."
    • VGS: يكتب مجموعة دقيقة من التعليمات (XPath) للحصول على تلك الصورة المحددة. ولأن استخدامه للخريطة البصرية أولاً، فإن هذه التعليمات أكثر دقة وأقل عرضة للتعطل إذا تغير موقع الويب قليلاً.

🏆 لماذا هذا مهم؟

اختبرت هذه الورقة البحثية هذا "المحقق البصري" (VGS) مقابل طرق أخرى في اختبار "موقع الويب الحي" الجديد (LIVEWEB-IE).

  • النتيجة: عانت الطرق القديمة (التي تقرأ دليل الكود) بشكل كبير، خاصة عندما كانت مواقع الويب معقدة أو تغيرت. لقد تاهت في وسط الضجيج.
  • الفائز: حقق VGS أداءً أفضل بكثير. فمن خلال النظر إلى الصورة المرئية أولاً لتضييق نطاق البحث، استطاع العثور على البيانات حتى عندما كان كود موقع الويب فوضوياً أو متغيراً.

📝 الخلاصة الكبرى

الإنترنت هو شيء حي ومتغير. لا يمكنك بناء أداة موثوقة لاستخراج البيانات من خلال النظر فقط إلى لقطات قديمة ومجمدة.

  • LIVEWEB-IE هو الاختبار الجديد والأكثر صعوبة الذي يجبر الروبوتات على التعامل مع الويب الحقيقي والمتغير.
  • VGS هو الاستراتيجية الجديدة التي تعلم الروبوتات "النظر قبل القفز"، باستخدام الإشارات البصرية للعثور على المعلومات تماماً كما يفعل البشر، بدلاً من الضياع في الكود البرمجي.

يمهد هذا البحث الطريق لأدوات أكثر ذكاءً وقوة لجمع المعلومات من الإنترنت تلقائياً دون أن تتعطل في كل مرة يتم فيها تحديث تصميم موقع الويب.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →