ملخص تقني: DataSpace: تقييم وكلاء البيانات للتحليلات القابلة للتحقق عبر مساحات عمل متباينة
1. بيان المشكلة
تظهر وكلاء البيانات كواجهات طبيعية للغة للبيانات التنظيمية، ومع ذلك، فإن الإعدادات التحليلية الواقعية تفرض تحديًا معقدًا: فالأدلة المطلوبة للإجابة على استعلام ما نادرًا ما تكون محتواة داخل جدول واحد نظيف. بدلاً من ذلك، تكون المعلومات مبعثرة عبر قواعد بيانات علاقية، وملفات مهيكلة/شبه مهيكلة (CSV, JSON)، ووثائق طويلة (PDF, Markdown)، ونماذج وسائط متعددة (فيديو)، وغالبًا ما تتضمن تنوعات عبر اللغات.
تفشل المعايير المرجعية الحالية في توحيد ثلاث خصائص حاسمة لتحليل البيانات الواقعي:
- نطاق مساحة العمل (Workspace Scope): غالبًا ما تعزل هذه المعايوهات الاستعلام المهيكل (مثل Spider) أو الاسترجاع غير المهيكل (مثل HotpotQA)، مما يفشل في التقاط المهام التي تتطلب اكتشاف وتكامل الأدلة عبر أنماط (modalities) متباينة داخل مساحة عمل محلية المهمة.
- عقد المخرجات (Output Contract): تقبل العديد من المعايوهات إجابات مكونة من حقائق، أو تقارير مفتوحة، أو خطوط تنفيذية (pipelines). بينما تتطلب التحليلات في العالم الحقيقي غالبًا نتيجة جدولية كاملة ومحددة النوع يمكن استهلاكها مباشرة.
- دلالات التقييم (Evaluation Semantics): تعتمد التقييمات الحالية غالبًا على قضاة يعتمدون على النماذج أو تفشل في التعامل مع التمثيلات المتكافئة (مثل اختلاف ترتيب الأعمدة، أو صياغة العناوين، أو الدقة الرقمية) بشكل حتمي.
تجادل الورقة بأن غياب معيار موحد يفرض عقد مخرجات جدولية كاملة عبر مساحات عمل متباينة اللغات والأنماط مع تقييم حتمي، سيحول دون القدرة على قياس التقدم في موثوقية وكلاء البيانات بدقة.
2. المنهجية
2.1 معيار DataSpace
DataSpace هو معيار يتكون من 410 مهام عابرة للغات و 7,439 قطعة أثرية (artifact) بإجمالي 15.01 جيجابايت.
- الأنماط (Modalities): تشمل مساحات العمل ملفات CSV، JSON، SQLite، Markdown، PDF، وفيديو.
- اللغات: تتضمن المهام سيناريوهات عابرة للغات حيث قد تمزج الأسئلة وقطع مساحة العمل بين الصينية والإنجليزية.
- صياغة المهمة: يتلقى الوكيل سؤالاً باللغة الطبيعية ومساحة عمل محلية للمهمة. يجب عليه اكتشاف المصادر ذاتيًا، ومواءمة الكيانات/المخططات (schemas)، وتنفيذ عمليات حسابية متعددة الخطوات (تصفية، دمج، تجميع)، وإرجاع النتيجة الجدولية الكاملة المطلوبة كملف CSV.
- المجالات: التحليلات المالية (الصناديق، الأسهم)، البيانات الاقتصادية الكلية، وتحليلات الرعاية الصحية.
2.2 DataSpace-Builder: إطار البناء
لبناء هذه المهام المعقدة بشكل موثوق، يقترح المؤلفون DataSpace-Builder، وهو إطار عمل قائم على التنفيذ يحول الحالات من معايير Text-to-SQL الموجودة (EHRSQL و BULL) إلى مهام مساحة عمل متباينة الأنماط. تتضمن العملية أربع مراحل:
- التحويل عبر اللغات (CLT): هجرة مشتركة للسؤال، وحالة قاعدة البيانات، وSQL القابل للتنفيذ. يضمن ذلك الاتساق المرجعي عن طريق ترجمة أسماء الكيانات والقيم مع الحفاظ على المعرفات والأكواد. يقوم قاضٍ يعتمد على LLM بالتحقق من المواءمة الدلالية بين السؤال المترجم وSQL.
- أخذ العينات العلاقاتية الواعية بالقيود: لتجنب مساحات العمل المتكررة، يقوم الإطار بأخذ عينات من الصفوف من قاعدة البيانات المصدرية مع الاحتفاظ بالمخطط الكامل. يستخدم مجموعة وقائية (المفاتيح الأساسية/الأجنبية، محددات الاستعلام) لضمان السلامة العلاقاتية (مثل الحفاظ على مسارات الربط/join) أثناء أخذ العينات.
- توجيه الأنماط وتجسيد القطع الأثرية (Artifact Rendering):
- التوجيه الأساسي: يتم تخصيص الجداول لمجسّدات (renderers) (CSV, JSON, SQLite, Markdown, PDF) بناءً على خصائص المخطط.
- تجسيد المستندات: يتم إنشاء مستندات طويلة (Markdown/PDF) من بيانات الجداول باستخدام LLMs، مما يضمن "التوليد المستند إلى الحقائق" حيث يمكن استعادة خلايا محددة من النص.
- تجسيد الفيديو: يتم تحويل البيانات الجدولية إلى فيديوهات تقدم رؤى حول البيانات. تُستخدم استراتيجيتان: تجريد المحددات (نقل شروط التصفية إلى سرد الفيديو) و تجسيد إجابة-الدليل (توزيع خلايا النتيجة عبر مشاهد الفيديو).
- المراجعة البشرية وإصلاح المهام: تقوم لجنة من 11 خبيرًا في المجال بمراجعات مستقلة وعمياء. يقومون بحل المهمة، والتحقق من المعيار الذهبي (gold standard)، وتأليف تكوين التقييم. تؤدي حالات الخلاف إلى إصلاحات قائمة على الأدلة للسؤال، أو مساحة العمل، أو الإجابة الذهبية.
2.3 المقيم الحتمي
بروتوكول التقييم خالٍ من النماذج و محايد للعناوين:
- مواءمة الأعمدة: يجد المقيم مطابقة واحد لواحد بين الأعمدة المتوقعة والمرجعية بغض النظر عن صياغة العنوان أو ترتيبه.
- التطبيع (Normalization): يتم تطبيع القيم بناءً على الأنواع الدلالية (نص، رقم، تاريخ، بولين) وقواعد الدقة (مثل الخانات العشرية، اتفاقيات النسب المئوية).
- مقارنة الصفوف: المهام التي تتطلب ترتيبًا تُقارن كمتتاليات؛ أما غيرها فتُقارن كمجموعات متعددة غير مرتبة.
- التسجيل (Scoring): تكون المهمة صحيحة فقط إذا تطابقت التوقعات الجدولية الكاملة مع المرجع تحت هذه الدلالات.
3. المساهمات الرئيسية
- معيار مساحة عمل متباينة الأنماط: يقدم DataSpace 410 مهمة تتطلب تركيب الملفات المهيكلة، وقواعد البيانات، والمستندات الطويلة، والفيديو في مخرج جدولي واحد قابل للتحقق.
- إطار بناء قائم على التنفيذ: يحول DataSpace-Builder موارد Text-to-SQL القابلة للتنفيذ إلى مهام متعددة الأنماط معقدة، مما يضمن اتساق البيانات من خلال ضمانات أخذ العينات ومراجعة الخبراء.
- مقيم مدرك للدلالات: بروتوكول حتمي يتسامح مع التمثيلات المتكافئة (إعادة ترتيب الأعمدة، التنسيق) بينما يرفض المخرجات غير المكتملة أو الخاطئة، مما يلغي الاعتماد على قضاة LLM.
- النتائج المرجعية التجريبية: ترسي الورقة خطوط أساس الأداء عبر ستة نماذج أساسية متعددة الأنماط وخمسة أطر عمل للوكلاء (agent harnesses)، مع تحديد الاختناقات المحددة في قدرات الوكلاء الحالية.
4. النتائج التجريبية
قيم المؤلفون ستة نماذج أساسية متعددة الأنماط (Grok 4.5, GPT-5.6 Sol, Kimi K3, MiMo-V2.5, Claude Sonnet 5, MiniMax M3) وخمسة أطر عمل للوكلاء (بما في ذلك DataSpace-Agent الخاص بهم).
- الأداء العام: حقق أفضل تكوين أداء (Grok 4.5 مع DataSpace-Agent) دقة بنسبة 66.34%. يشير هذا إلى أن المعيار غير مشبع، حيث فشلت جميع النماذج الستة في حل 76 مهمة، بينما تم حل 56 مهمة بواسطة جميع النماذج.
- تأثير إطار العمل (Harness Impact): يؤثر اختيار إطار عمل الوكيل بشكل كبير على الأداء. مع تثبيت نموذج MiMo-V2.5، تباينت الدقة بمقدار 15.36 نقطة مئوية عبر مختلف أطر العمل (تراوحت بين 30.98% و 46.34%).
- التحديات الرئيسية:
- التكامل متعدد الأنماط: قللت المهام التي تتطلب أدلة متعددة الأنماط من الدقة باستمرار عبر جميع النماذج الأساسية بمقدار 1.8–14.0 نقطة مقارنة بالمهام أحادية النمط.
- عمليات الربط (Joins): قللت عمليات الربط الدقة بمقدار 9.7–19.8 نقطة.
- الكفاءة: حقق GPT-5.6 Sol دقة قريبة من القمة (64.63%) باستخدام 74.2% أقل من الرموز (tokens) و 50.3% أقل من الإجراءات مقارنة بالأفضل أداءً، Grok 4.5.
- تحليل الفشل: كشفت عملية تدقيق لـ 136 حالة فشل لنموذج Grok 4.5 أن 52.2% من الأخطاء نشأت في تجسيد الإجابة (على سبيل المثال، إضافة/حذف أعمدة أو صفوف بعد حساب النتيجة الداخلية الصحيحة)، وليس في اكتشاف الأدلة أو استخراجها. كانت 5 حالات فقط من أصل 13 حالة "عدم تقديم" هي حالات فشل إنهاء بحتة؛ معظمها نبع من أخطاء مستمرة سابقة.
5. الأهمية والادعاءات
تدعي الورقة أن DataSpace يضع اختبارًا صارمًا لتقدم وكلاء البيانات الموثوقة. تكمن أهميته الأساسية في نقل نموذج التقييم من المهارات المعزولة (مثل توليد SQL أو استرجاع المستندات) إلى حل مساحة العمل بالكامل مع عقد مخرجات صارم وقابل للتحقق.
يخلص المؤلفون بتواضع إلى أنه بينما تظهر النماذج الرائدة الحالية وعودًا، لا تزال هناك فجوات كبيرة في التكامل عبر الأنماط و عمليات الربط. يسلط المعيار الضوء على أن القدرة على "إيجاد" البيانات ليست كافية؛ بل يجب على الوكلاء أيضًا تجسيد هيكل المخرجات المطلوب بدقة. تشير النتائج إلى أن تحسين موثوقية وكيل البيانات يتطلب معالجة خط الإنتاج الكامل بدءًا من اكتشاف الأدلة المتباينة وصولًا إلى التسلسل الجدولي الدقيق، بدلاً من التركيز فقط على قدرات الاستدلال.
يعمل DataSpace كمعيار تقييم رسمي لـ مسابقة KDD Cup 2026: وكلاء البيانات للتحليلات المعقدة للبيانات، مما يوفر بيئة معيارية وقابلة للتكرار للبحوث المستقبلية في هذا المجال.