← أحدث الأبحاث
💬 NLP

DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?

تقدم هذه الورقة DSAgentBench، وهو أول معيار مصمم لتقييم قدرة وكلاء الذكاء الاصطناعي على أتمتة سير عمل علم البيانات من البداية إلى النهاية ضمن بيئات حاسوبية حقيقية، مما يكشف عن فجوة أداء كبيرة حيث تواجه حتى أقوى النماذح صعوبة في تنسيق الأدوات والاستنتاج متعدد الخطوات.

المؤلفون الأصليون: Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque Prince

نُشر 2026-08-12
📖 1 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque Prince

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

ملخص تقني: DSAgentBench

بيان المشكلة

تتضمن علوم البيانات في العالم الحقيقي سير عمل معقدة وطويلة الأمد تمتد من معالجة البيانات والاستكشاف إلى النمذجة، والتصور، والتحقق. تتطلب هذه المهام استخداماً منسقاً لأدوات متنوعة — بما في ذلك دفاتر الملاحظات (notebooks)، وبيئات التطوير المتكاملة (IDEs)، وواجهات السطر البرمجي (terminals)، والمتصفحات، وقواعد البيانات — ضمن نظام تشغيل يعمل بشكل كامل. وبينما أظهرت التطورات الأخيرة في النماذج اللغوية الكبيرة (LLMs) قدرات في توليد الكود أو تنفيذ مهام تحليلية معزولة، إلا أن المعايções المرجعية الحالية تفشل في تقييم ما إذا كانت الوكلاء (agents) قادرين على تنفيذ سير عمل كامل لعلوم البيانات من البند إلى البند بشكل مستقل في بيئات حوسبة واقعية.

تنقسم المعايين المرجعية الحالية إلى فئتين: تلك التي تقيم توليد الكود بمعزل عن غيره (مثل DS-1000 وDSEval) دون اشتراط التفاعل مع النظام، وتلك التي تقيم التحكم العام في الحاسوب (مثل OSWorld وWebArena) دون تقييم الاستدلال التحليلي الخاص بالمجال. وبناءً على ذلك، هناك نقص في أطر التقييم التي تختبر قدرة الوكيل على التنقل في أنظمة الملفات، وإدارة التبعيات، وتفسير الأخطاء، وتحسين التحليلات بناءً على المخرجات الوسيطة داخل بيئة نظام تشغيل حقيقية.

المنهجية

بناء المعيار المرجعي (DSAgentBench)

يقدم المؤلفون DSAgentBench، وهو أول معيار مرجعي مصمم لتقييم سير عمل علوم البيانات المستقلة داخل أنظمة التشغيل الحقيقية. يتكون المعيار من 275 مهمة متنوعة من تأليف بشر تغطي دورة حياة علوم البيانات بأكملها.

  • صياغة المهام: تُعرف المهام كأزواج مرتبة (Ci,Ii,Vi)(C_i, I_i, V_i)، حيث CiC_i هو تكوين النظام الأولي (مجموعات البيانات، هيكل الملفات، المكتبات المثبتة)، وIiI_i هي تعليمات باللغة الطبيعية، وViV_i هو مقيم بايثون حتمي.
  • مصادر البيانات: تم استقاء مجموعات البيانات من مصادر واقعية متباينة، تشمل Kaggle وOpenML وGitHub وقواعد بيانات SQLite وواجهات برمجة تطبيقات الويب (APIs). تتضمن البيانات أنماطاً جدولية (95.3%)، وصوراً (3.6%)، ونصوصاً (1.1%).
  • فئات المهام: تنقسم المهام إلى ست فئات من القدرات: الحصول على البيانات، تحليل البيانات الاستكشافي (EDA)، هندسة الميزات، النمذجة، التقييم/النشر، والتصور/التقارير.
  • بروتوكول التقييم: على عكس المعايين التي تقيم تنفيذ الكود، يستخدم DSAgentBench مقيمات حتمية تتحقق من الصحة التحليلية، وجودة المخرجات المرئية، وأداء النموذج. تُعتبر المهمة ناجحة فقط إذا استوفت مخرجات الوكيل معايير المقيم (الدرجة 0.95\ge 0.95).
  • خط إنتاج المعيار: بُني المعيار عبر عملية من ثلاث مراحل: استقاء مجموعات البيانات، تصميم المهام/المقيمين بالتعاون مع خبراء بشريين (مع استخدام النماذج اللغوية الكبيرة للتحسين فقط)، والتحقق بواسطة مدققين مزدوجين لضمان قابلية التكرار والصحة التقنية.

بنية البيئة

يعتمد DSAgentBench على إطار عمل OSWorld لإنشاء بيئة تنفيذ واقعية:

  • نظام التشغيل: Ubuntu مع بايثون ومكتبات علوم البيانات المثبتة مسبقاً.
  • الأدوات: Visual Studio Code، وJupyter Notebook، وChrome، والوصول إلى واجهات برمجة تطبيقات Kaggle وOpenML.
  • فضاء الملاحظة: يتلقى الوكلاء إما لقطة شاشة بدقة 1920×1080 أو نمط هجين من لقطة الشاشة + شجرة إمكانية الوصول (A11y)، والذي يوفر بيانات وصفية مهيكلة لواجهة المستخدم (الأدوار، مربعات الإحاطة، حالات التفاعل).
  • فضاء الإجراءات: يتفاعل الوكلاء عبر إجراءات واجهة المستخدم الرسومية (نقرات الماوس، إدخال لوحة المفاتيح) والإجراءات الوصفية (WAIT, DONE, FAIL). تلتقط البيئة انتقالات الحالة بعد كل إجراء.

النماذج التي تم تقييمها

قام المؤلفون بتقييم 15 وكيلاً من المصادر المغلقة والمفتوحة، بما في ذلك:

  • المصادر المغلقة: GPT-4o، وGPT-5 (ونسخته المصغرة)، وO4-mini، وClaude Sonnet 4/4.5/4.6، وGemini 2.5 Pro، وكمبيوتر OpenAI الوكيل (OpenAI's Computer Agent).
  • المصادر المفتوحة: UI-TARS (2B/7B)، وGUI-OWL-7B، وOpenCUA-72B، ونماذج هجينة (Jedi مقترن بـ GPT-4o).

النتائج الرئيسية

الأداء العام

تكشف التجارب عن فجوة قدرات كبيرة بين الأنظمة الوكيل الحالية ومتطلبات سير عمل علوم البيانات الحقيقية:

  • أقوى وكيل: حقق Claude-4.6-Sonnet أعلى أداء بنسبة نجاح في المهام بلغت 56.70% تحت إعداد لقطة الشاشة + شجرة A11y.
  • النماذج الأخرى ذات المصدر المغلق: انخفض الأداء بشكل كبير للنماذج الأخرى، حيث سجل GPT-5 نسبة 29.81%، بينما تراوح غيره (GPT-4o، Gemini-2.5-Pro) حول 20%.
  • النماذج مفتوحة المصدر: حققت جميع الوكلاء مفتوحي المصدر أقل من 1% من النجاح، حيث فشلت بشكل متكرر في تنسيق الأدوات، والتمركز في نظام التشغيل (OS grounding)، والاستدلال متعدد الخطوات.
  • المعيار البشري: حقق الخبراء البشر معدل نجاح بنسبة 85.09%، مما يسلط الضوء على الفجوة المتبقية حتى بالنسبة لأقوى وكلاء الذكاء الاصطناعي.

تحليل الاستئصال والأخطاء

  • تعقيد المهمة: يتدهور الأداء بشكل رتيب مع زيادة الصعوبة. تظل المهام "الصعبة" (أكثر من 5 خطوات) هي الأكثر تحدياً. سير العمل متعدد المراحل (56.7% من المهام) أصعب بكثير من المهام أحادية المرحلة بسبب الحاجة إلى الحفاظ على الحالة والتعافي من الأخطاء.
  • استخدام الأدوات: أدت المهام التي نُفذت في Jupyter Notebooks أداءً أفضل من تلك التي نُفذت في VS Code، ويرجع ذلك أساساً إلى قلة أخطاء الطرفية (terminal) والبيئة.
  • نمط الملاحظة: أدى إضافة معلومات شجرة A11y عموماً إلى تحسين الأداء، مما يشير إلى أن البيانات الوصفية المهيكلة لواجهة المستخدم تساعد في التمركز (grounding)، وإن تباينت المكاسب حسب النموذج.
  • أنماط الفشل:
    • الوكلاء مفتوحي المصدر: فشلوا بشكل شبه كامل (97–98%) بسبب أخطاء التمركز (عدم القدرة على مواءمة التعليمات مع حالة سطح المكتب).
    • الوكلاء الأقوى مغلقي المصدر: أظهروا حالات فشل مختلطة، بما في ذلك أخطاء الطرفية، وعيوب توليد الكود، ونقص في الاستدلال.
    • البنية الزمنية: غالباً ما فشلت النماذج مفتوحة المصدر والضعيفة في مراحل مبكرة (عدم القدرة على فتح الطرفية)، بينما مالت النماذج الأقوى إلى الفشل في المراحل اللاحقة بعد استكشاف طويل وغير فعال.
  • الحساسية للميزانية: لم يؤدِ زيادة ميزانية التفاعل من 15 إلى 50 خطوة إلا إلى مكاسب طفيفة (24.54% \to 25.81%)، مما يشير إلى أن الفشل لا يعود أساساً إلى حدود الخطوات ولكن إلى مشكلات جوهرية في التخطيط والاستدلال.

الأهمية والادعاءات

يضع البحث DSAgentBench كأداة أساسية لتطوير وكلاء علوم بيانات مستندين إلى الواقع، وقابلين للتحقق، ومستقلين. وتتمثل مساهماته الرئيسية في:

  1. أول معيار مرجعي لنظام تشغيل حقيقي: هو أول معيار لتقييم سير عمل علوم البيانات المستقلة داخل نظام تشغيل يعمل، مغطياً الدورة الكاملة من الحصول على البيانات إلى التحقق.
  2. التقييم القائم على التنفيذ: ينقل نموذج التقييم من "صحة الكود" إلى "الصحة التحليلية"، مما يتطلب من الوكلاء إنتاج مخرجات صالحة (تصورات، نماذج، تقارير) يتم التحقق منها بواسطة سكربتات حتمية.
  3. كشف الفجوة: تكشف النت فيه عن محدودية كبيرة في الأنظمة الوكيل الحالية، حيث تثبت أن أقوى النماذج تعاني في تنسيق الأدوات، والاستدلال طويل الأمد، والتمركز في نظام التشغيل المطلوب لعلوم البيانات الحقيقية.
  4. التوجه المستقبلي: من خلال تحديد أنماط الفشل المحددة (التمركز، التخطيط، تنسيق الأدوات)، يوفر المعيار خارطة طريق واضحة للأبحاث المستقبلية التي تهدف إلى بناء وكلاء قادرين على أداء مهام علوم البيانات الواقعية.

أصدر المؤلفون المعيار المرجعي عبر الرابط https://github.com/vis-nlp/DSAgentBench لتسهيل المزيد من الأبحاث في هذا المجال.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →