← أحدث الأبحاث
💻 computer science

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

تقدم هذه الورقة DataSpace، وهو معيار شامل وإطار تقييم لمسابقة KDD Cup 2026 مصمم لتقييم قدرة وكلاء البيانات على توليد نتائج جدولية قابلة للتحقق من مساحات عمل متباينة ومتعددة الوسائط، مما يكشف عن فجوات أداء كبيرة في دمج الأدلة متعددة الوسائط والتأثير الجوهري لخيارات تسخير الوكيل على الموثوقية.

المؤلفون الأصليون: Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

نُشر 2026-08-05
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق يحاول حل لغز ما، لكن أدلتك مبعثرة في كل مكان. بعضها في جدول بيانات منظم على حاسوبك، وبعضها مدفون داخل تقرير بصيغة PDF مكون من 50 صفحة، وبعضها الآخر مخفي داخل قاعدة بيانات، وأهم دليل قد يكون مقطع فيديو لكاميرا مراقبة. هذا هو الواقع اليومي لـ "وكلاء البيانات" (data agents) — وهي برامج حاسوبية ذكية مصممة للإجابة على الأسئلة من خلال البحث في الملفات الرقمية الفوضوية للمؤسسات. لفترة طويلة، اختبر العلماء هؤلاء الوكلاء في ألغاز نظيفة ومن نوع واحد، مثل البحث عن اسم في دليل هاتف أو طرح سؤال بسيط على قاعدة بيانات. لكن في العالم الحقيقي، تكون البيانات مزيجاً فوضوياً من اللغات والتنسيقات والوسائط. السؤال الكبير الذي يطرحه الباحثون هو: هل يمكن لهؤلاء المحققين الرقميين تجميع قصة كاملة من كومة أدلة مختلطة، أم أنهم يضيعون عندما لا تبدو الأدلة متشابهة؟

تقدم هذه الورقة البحثية اختباراً جديداً وشديد الصعوبة يسمى DataSpace لمعرفة مدى جودة هؤلاء الوكلاء في حل هذه الألغاز الواقعية الفوضوية. قام الباحثون ببناء ساحة لعب ضخمة تحتوي على 410 مهام مختلفة و 7,439 قطعة أثرية رقمية (ملفات) يبلغ إجمالي حجمها 15.01 جيجابايت من البيانات. لم يكتفوا بإلقاء ملفات عشوائية معاً؛ بل أنشأوا "مساحة عمل غير متجانسة" حيث قد يتطلب منك سؤال واحد قراءة فيديو، وفحص ملف PDF، والاستعلام من قاعدة بيانات، ومقارنة بيانات من ملف JSON، كل ذلك أثناء التعامل مع أدلة مكتوبة باللغتين الإنجليزية والصينية. الهدف ليس مجرد العثور على حقيقة واحدة؛ بل يجب على الوكيل إنتاج جدول كامل وقابل للتحقق من الإجابات، مثل تقرير دراسي نهائي.

نتائج هذا الاختبار هي بمثابة جرس إنذار. فحتى أذكى نماذج الذكاء الاصطناعي الأكثر تقدماً التي تم اختبارها (بما في ذلك عمالقة مثل Grok 4.5 و GPT-5.6) تمكنت فقط من حل حوالي 66.34% من المهام بشكل صحيح. وهذا يعني أنها أخفقت في حل لغز واحد من كل ثلاثة ألغاز تقريباً. وجد الباحثون أن الوكلاء يعانون أكثر عندما يتعين عليهم دمج المعلومات من أنواع مختلفة من الوسائط (مثل ربط دليل من فيديو بجدول بيانات) أو عندما يحتاجون إلى إجراء عمليات "ربط" (joins) معقدة (ربط البيانات من مصدرين مختلفين). ومن المثير للاهتمام أن اختيار "الحامل" (harness) — وهو إطار البرمجيات الذي يخبر الذكاء الاصطناعي بكيفية استخدام أدواته — كان مهماً بقدر أهمية عقل الذكاء الاصطناعي نفسه، حيث تسبب في فرق قدره 15.36 نقطة في الدرجات.

في النهاية، تظهر الورقة البحثية أنه بينما يتحسن وكلاء البيانات، إلا أنهم بعيدون كل البعد عن المثالية. فهم غالباً ما يحصلون على الأرقام الصحيحة لكنهم يفشلون في تنسيق الجدول النهائي بشكل صحيح، أو قد يفتقدون دليلاً حاسماً مخفياً في فيديو. ويخلص المؤلفون إلى أننا لا نزال أمام طريق طويل قبل أن نتمكن من الثقة الكاملة في هؤلاء الوكلاء للتعامل مع تحليل البيانات المعقدة ومتعددة التنسيقات بمفردهم، وقد قدموا هذا المعيار كخريطة تساعد المهندسين في المستقبل على إصلاح نقاط الضعف المحددة هذه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →