DRBench: A Realistic Benchmark for Enterprise Deep Research
تقدم هذه الورقة DRBench، وهو معيار مرجعي واقعي يتكون من 100 مهمة بحث عميق متعددة الخطوات تم التحقق منها بشرياً عبر 10 مجالات مؤسسية، والتي تقيم قدرة وكلاء الذكاء الاصطناعي على تخليق المعلومات من كل من الويب العام وبيانات الشركة الخاصة لإنشاء تقارير دقيقة ومنظمة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك وظفت مساعد بحث ذكي للغاية ولا يكلّ يُدعى "الذكاء الاصطناعي". تسأله سؤالاً بسيطاً مثل: "ما هي حالة الطقس في طوكيو؟"، فيتحقق من الإنترنت ويعطيك الإجابة فوراً. هذا أمر سهل.
ولكن الآن، تخيل أنك أعطيت نفس المساعد وظيفة أصعب بكثير في العالم الحقيقي: "اطلع على رسائل البريد الإلكتروني الخاصة بشركتنا، وتحقق من جداول بيانات المبيعات الداخلية لدينا، وامسح سجلات الدردشة الخاصة بنا، ثم قارن كل ذلك بآخر الأخبار على شبكة الإنترنت المفتوحة. وبناءً على كل ما تجده، اكتب تقريراً يخبرنا كيف نغير خطة منتجنا حتى لا نخالف قوانين السلامة الجديدة."
هذا هو بالضبط جوهر ورقة البحث DRBench. إليك التفاصيل بتبسيط شديد:
١. المشكلة: "اختبار جوجل" مقابل "العالم الحقيقي"
كانت الاختبارات السابقة للذكاء الاصطناعي تشبه الاختبار من متعدد. كانت تطرح أسئلة بسيطة حيث تكون الإجابة على بُعد نقرة واحدة فقط على جوجل. لكن في عالم الأعمال الحقيقي، لا توجد الإجابات جاهزة في صفحة ويب واحدة. بل هي مخبأة في كومة فوضوية من:
- وثائق الشركة الخاصة (مثل خزانة ملفات مغلقة).
- رسائل البريد الإلكتروني القديمة ورسائل "سلاك" (مثل دردشة جماعية فوضوية).
- الأخبار والمواقع العامة (مثل الإنترنت المفتوح).
كانت اختبارات الذاء الاصطناعي القديمة تشبه طلب حل مسألة رياضية من طالب على سبورة بيضاء نظيفة. أما DRBench فهو يشبه إلقاء ذلك الطالب في مكتبة مزدحمة، ومكتب صاخب، وموقع بناء في آن واحد، ثم تطلب منه بناء منزل.
٢. الحل: DRBench (صالة الألعاب الرياضية لـ "البحث العميق")
ابتكر المؤلفون DRBench، وهو في الأساس صالة ألعاب رياضية لوكلاء الذكاء الاصطناعي. فبدلاً من رفع أوزان خفيفة (أسئلة بسيطة)، هم يرفعون مهاماً ثقيلة ومعقدة.
- التمارين: أنشأوا ١٠٠ سيناريو واقعي عبر ١٠ أقسام مختلفة (مثل المبيعة، والأمن السيبراني، والامتثال).
- القواعد: يجب على الذكاء الاصطناعي أن يكون محققاً. لا يمكنه مجرد التخمين؛ بل عليه التنقيب في "الخزنة الخاصة" (بيانات الشركة) و"الساحة العامة" (الويب) للعثور على الأدلة.
- الهدف: لا يتم تقييم الذكاء الاصطناعي فقط على إيجاد الإجابة؛ بل يتم تقييمه على مدى قدرته على ربط النقاط ببعضها، وقول الحقيقة، وكتابة تقرير واضح ومنظم يمكن لمدير بشري استخدامه فعلياً.
٣. كيف بنوا ذلك؟
لم يقوموا بمجرد اختراع أسئلة وهمية. لقد استخدموا وصفة خاصة:
١. التوليف: استخدموا الحواسيب لتوليد "شخصيات" واقعية (مثل مدير مبيعات مضغوط أو مسؤول امتثال صارم).
٢. التحقق البشري: تدخل بشر حقيقيون للتحقق من أن المهام منطقية وأنها صعبة بما يكفي بالفعل.
٣. النتيجة: مجموعة بيانات ضخمة من ١٠٠ مهمة "بحث عميق" تحاكي فوضة وتعقيد المكتب الحقيقي.
٤. لماذا هذا مهم؟
اختبر المؤلفون العديد من نماذج الذكاء الاصطناعي المختلفة (مثل GPT وLlama وQwen) في هذه الصالة الرياضية الجديدة. ووجدوا أنه بينما يتفوق بعض الذكاء الاصطناعي في المعلومات العامة البسيطة، إلا أنها غالباً ما تضل طريقها عندما تتطلب المهمة التوفيق بين البيانات الخاصة والمعلومات العامة في وقت واحد.
باختصار:
اعتبر DRBench بمثابة الألعاب الأولمبية لباحثي الذكاء الاصطناعي. قبل هذا، كان الذكاء الاصطناعي يتنافس في سباق ١٠٠ متر (إجابات سريعة وبسيطة). أما الآن، فهم يتنافسون في السباعي/العشاري، حيث يتعين عليهم الجري، والقفز، والرمي، واجتياز عقبات معقدة (البيانات الخاصة، الويب المفتوح، والمنطق الاستدلالي) جميعها في آن واحد.
يساعد هذا المعيار الشركات على معرفة أي مساعد ذكاء اصطناعي مستعد فعلياً للتعامل مع العمل الفوضوي والمعقد لإدارة الأعمال، بدلاً من مجرد الإجابة على أسئلة بسيطة.
أين تجده: إذا كنت تريد رؤية "الصالة الرياضية" بنفسك، فإن الكود والبيانات متاحة للجميع للاستخدام على GitHub.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.