← أحدث الأبحاث
💬 NLP

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

تقدم هذه الورقة ScrapeGraphAI-100k، وهي مجموعة بيانات ضخمة من الواقع تتكون من 93,695 حدث استخراج مقيد بالمخطط (schema-constrained) مستمدة من القياس عن بُعد للممارسين، مما يتيح تدريب واختبار النماذج اللغوية الكبيرة على مهام التوليد المهيكل حيث كانت المجموعات السابقة الاصطناعية أو المقتصرة على النصوص غير كافية.

المؤلفون الأصليون: William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

نُشر 2026-05-11
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً جداً، ولكنه ثرثار أحياناً (نموذج لغوي كبير). تطلب منه قراءة صفحة ويب فوضوية واستخراج تفاصيل محددة، مثل سعر حذاء أو مؤلف مقال. أنت تريد الإجابة في صندوق مثالي ومنظم (مخطط JSON)، وليس في فقرة مطولة.

المشكلة هي أنه بينما نمتلك الكثير من البيانات حول كيفية "تحدث" هذه الروبوتات، إلا أننا لا نملك بيانات كافية حول كيفية "استخراج" المعلومات من المواقع الإلكترية الحقيقية عندما تعطيها قواعد صارمة. معظم مجموعات البيانات الموجودة حالياً تشبه التمارين التدريبية التي يتم إعدادها في المختبر؛ فهي لا تشبه المواقع الإلكترونية الحقيقية والفوضوية التي يستخدمها الناس فعلياً.

إليك "ScrapeGraphAI-100k".

اعتبر هذه الورقة البحثية بمثابة تقديم لدليل تدريب ضخم من العالم الحقيقي لهذه الروبوتات. إليك التفاصيل بتبسيط شديد:

1. "النادي الرياضي للواقع الحقيقي"

لم يقم المؤلفون بتأليف مواقع وهمية، بل جمعوا 93,695 مثالاً حقيقياً لأشخاص يستخدمون برمجياتهم لسحب البيانات من الإنترنت.

  • المصدر: لقد سألوا 9 ملايين مستخدم لأداتهم مفتوحة المصدر عما إذا كان بإمكانهم مشاركة ما يفعلونه بشكل مجهول، وتم الاحتفاظ بنحو 93,000 تفاعل بعد تنظيف البيانات من المكررات والضجيج.
  • "الرباعي": كل مثال في مجموعة البيانات هذه هو قصة كاملة تتكون من:
    1. المحتوى: نص صفحة الويب (محول إلى صيغة Markdown، مثل مستند نظيف).
    2. الطلب: أمر الإنسان (مثلاً: "احصل على السعر والمقاس").
    3. القواعد: الصندوق الصارم (مخطط JSON) الذي كان على الروبوت ملؤه.
    4. النتيجة: ما كتبه الروبوت بالفعل.

2. "فخ التعقيد"

حلل الباحثون هذه الأمثلة ووجدوا نمطاً مثيراً للاهتمام، يشبه لوحة تحديد السرعة للروبوتات.

  • المهام البسيطة: إذا كانت القواعد (المخطط) بسيطة (مثل طلب الاسم والسعر فقط)، فإن الروبوتات تكون بارعة في اتباعها.
  • الهاوية: كلما زاد تعقيد القواعد (مجلدات متداخلة أكثر، حقول أكثر، منطق "إذا/إذن" أكثر)، بدأت الروبوتات في الانهيار.
  • النتيجة: هناك "عتبة فشل" حادة. بمجرد أن يصبح طقم القواعد عميقاً جداً أو يحتوي على الكثير من المفاتيح، تنخفض نسبة النجاح بشكل حاد كالحجر. الأمر يشبه أن تطلب من إنسان ملء استمارة تحتوي على 500 حقل؛ في النهاية، سيستسلم أو يرتكب الأخطاء.

3. تجربة "الطالب مقابل المعلم"

لإثبات فائدة مجموعة البيانات هذه، أجرى المؤلفون تجربة صغيرة، تشبه مشروع معرض العلوم:

  • المعلم: نموذج ذكي جداً ومكلف (GPT-5-nano) قام بتوليد إجابات مثالية لمجموعة البيانات.
  • الطالب: نموذج صغير ورخيص (1.7 مليار معلمة) تم "تعليمه" باستخدام مجموعة البيانات الجديدة هذه.
  • النتيجة: تعلم الطالب الصغير جيداً من الأمثلة الواقعية لدرجة أنه بدأ يتصرف بشكل جيد تقريباً مثل نموذج أكبر وأغلى بكراً (30 مليار معلمة) عندما يتعلق الأمر باتباع القواعد الصارمة.
  • العقبة: كان الطالب بارعاً في رسم "إطار" الصندوق بشكل صحيح (الدقة الهيكلية)، لكنه كان لا يزال يعاني أحياناً في جعل "الكلمات الدقيقة" داخل الصندوق مثالية (الصحة الدلالية).

4. ماذا يوجد داخل الصندوق؟

  • اللغات: معظم البيانات باللغة الإنجليزية والصينية التقليدية (حوالي 88% من البيانات)، وتغطي 18,000 نوع مختلف من "أطقم القواعد".
  • ما ينقصنا: تعترف الورقة بأنهم لم يدرجوا كود HTML الخام والفوضوي للمواقع (فقط النسخة النصية النظيفة)، وليس لديهم معيار ذهبي "موثق بشرياً" لكل إجابة حتى الآن. إنهم يدخرون ذلك لتحديث مستقبلي (الإصدار 2.0).

الخلاصة

تقول هذه الورقة: "لقد بنينا مكتبة ضخمة من الأمثلة الواقعية حيث حاولت الروبوتات اتباع قواعد صارمة لاستخراج البيانات. وجدنا أن الروبوتات تصاب بالارتباك عندما تصبح القواعد معقدة للغاية، ولكن إذا قمت بتدريب روبوت صغير على هذه البيانات الحقيقية، فيمكنه تعلم اتباع القواعد بشكل جيد تقريباً مثل الروبوت العملاق."

إنها أداة للباحثين لبناء أدوات ذكاء اصطناعي أفضل، أصغر، وأكثر كفاءة يمكنها قراءة المواقع الإلكترونية دون أن تضيع في التفاصيل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →