← أحدث الأبحاث
💬 NLP

BEAVER: An Enterprise Benchmark for Text-to-SQL

تقدم الورقة البحثية BEAVER، وهو أول معيار مرجعي لتحويل النص إلى لغة SQL مستمد من مستودعات بيانات الشركات الخاصة ويضم 9,128 استعلاماً من واقع العمل عبر 19 مجالاً، والذي يكشف عن فجوة أداء كبيرة للنماذج المتطورة ويقترح إطار تقييم دقيق لتشخيص التحديات المعقدة مثل المعرفة بالمجال واستخدام الدوال المتقدمة.

المؤلفون الأصليون: Peter Baile Chen, Devin Yang, Weiyue Li, Fabian Wenz, Yi Zhang, Nesime Tatbul, Michael Cafarella, Çağatay Demiralp, Michael Stonebraker

نُشر 2026-05-14
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Peter Baile Chen, Devin Yang, Weiyue Li, Fabian Wenz, Yi Zhang, Nesime Tatbul, Michael Cafarella, Çağatay Demiralp, Michael Stonebraker

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة وفوضوية، حيث لا تُنظم الكتب حسب العنوان أو المؤلف، بل وفق رمز سري لا يعرفه إلا أمناء المكتبة. الرفوف مُلصق عليها رموز غامضة مثل "FCLT_ROOMS" بدلاً من "الفصول الدراسية"، والكتب مبعثرة عبر آلاف الغرف المختلفة.

الآن، تخيل أنك تريد أن تسأل أمين المكتبة: "أرني أفضل 10 فصول في مبنى الفنون التي تُقام في غرف تزيد مساحتها عن 400 قدم مربع". في المكتبة العادية، ستكتفي بقول ذلك وسوف يجدها لك. لكن في هذه المكتبة السرية، على أمين المكتبة (الذكاء الاصطناعي) أن يقوم بـ:

  1. التخمين أي 5 غرف يجب أن يبحث فيها.
  2. اكتشاف أن "مبنى ستاتا" هو في الواقع كود لـ "الغرفة 32".
  3. الربط بين النقاط بين كتب لا تبدو مرتبطة ببعضها البعض على الإطلاق.
  4. القيام بعمليات حسابية معقدة لتصنيف الفصول.

هذه هي المشكلة التي يحاول BEAVER حلها.

المشكلة: المكتبة "النظيفة جداً"

لسنوات، قام العلماء بتدريب الذكاء الاصطناعي على تحويل الأسئلة البشرية إلى أوامر قواعد بيانات (تسمى Text-to-SQL). لقد اختبروا هذه الأنظمة باستخدام "مكتبات تدريبية" (اختبارات مرجعية عامة مثل Spider أو BIRD). هذه المكتبات التدريبية تشبه مجموعات الألعاب: الرفوف مرتبة، الملصقات واضحة، والأسئلة بسيطة.

في هذه المجموعات التدريبية، يبدو الذكاء الاصطناعي عبقرياً، حيث يصيب أكثر من 80% من الإجابات. لكن مؤلفي الورقة البحثية يقولون: "هذا يشبه اختبار سيارة سباق على مضمار ناعم ثم افتراض أنها تستطيع القيادة عبر مستنقع طيني". قواعد بيانات الشركات الحقيقية هي المستنقع الطيني: ضخمة، فوضوية، مليئة بالأكواد السرية، والأسئلة التي يطرحها الناس معقدة للغاية.

الحل: BEAVER (محاكي المستنقع)

قام الفريق بإنشاء BEAVER، وهو أول "تجربة قيادة" للذكاء الاصطناعي باستخدام بيانات حقيقية وفوضوية من قواعد بيانات شركات خاصة.

  • البيانات: جمعوا 9,128 سؤالاً وإجابة حقيقية من ثلاث شركات مختلفة (جامعة، مختبر أبحاث، ومرفق سكني).
  • النطاق: هذه ليست مجموعات ألعاب؛ فمتوسط قاعدة البيانات يحتوي على أكثر من 100 جدول (أرفف) وما يقرب من 900 عمود (صفوف من البيانات). الأسئلة طويلة وتتطلب تفكيراً عميقاً.
  • التوسع: نظرًا لعدم قدرتهم على الحصول على قدر كافٍ من البيانات الحقيقية بسبب قواعد الخصوصية، قاموا ببناء "آلة قوالب". لقد أخذوا هيكل الأسئلة الحقيقية (مثل "جد أفضل 10...") وخلطوها بتفاصيل شركات مختلفة لإنشاء آلاف الأسئلة التدريبية الجديدة والواقعية.

الخطوات الخمس الخفية (المهام الفرعية)

تجادل الورقة البحثية بأن الوصول إلى الإجابة النهائية ليس مجرد قفزة واحدة كبيرة. الأمر يشبه خبز كعكة؛ إذا أخطأت في خطوة واحدة، ستفشل الكعكة بأكملها. لقد قسموا مهمة الذكاء الاصطناعي إلى خمس خطوات محددة لمعرفة أين يفشل:

  1. إيجاد الغرف الصحيحة (استرجاع متعدد الجداول): أي 5 أرفف أحتاج للنظر إليها؟
  2. الربط بين النقاط (كشف مفتاح الربط): كيف أربط رف "الغرفة" بـ رف "الفصل" عندما لا تملك تسميات متطابقة؟
  3. فك تشفير الملصقات (تخطيط الأعمدة): هل يعني "مبنى ستاتا" العمود X أم العمود Y؟
  4. معرفة الأسرار (المعرفة بالمجال): أنا أعلم أن "مبنى ستاتا" هو في الواقع "مفتاح المبنى 32"، رغم أن هذه الحقيقة ليست مكتوبة في السؤال.
  5. التقسيم (تفكيك الاستعلام): هذا السؤال صعب جداً ليتم حله دفعة واحدة. أحتاج لحل الجزء (أ)، ثم الجزء (ب)، ثم دمجهما معاً.

النتائج: مواجهة الواقع

عندما اختبروا أذكى نماذج الذكاء الاصطناعي المتاحة (بما في ذلك أحدث النماذج من OpenAI وغيرها) على BEAVER، كانت النتائج صادمة.

  • الدرجة: بدلاً من 80%، لم يحصل أفضل ذكاء اصطناعي إلا على 10.8% فقط من الإجابات الصحيحة.
  • اختبار "ورقة الغش": بعد ذلك، أعطى الباحثون الذكاء الاصطناعي "ورقة غش" (الإجابات الصحيحة لتلك الخطوات الخمس). وحتى مع ورقة الغش، ارتفعت درجة الذكاء الاصطناعي إلى 30.1% فقط.

ماذا يعني هذا؟
هذا يعني أن الذكاء الاصطناعي يفشل في أمرين أساسيين:

  1. الأساسيات: لا يمكنه حتى إيجاد الأرفف الصحيحة أو الربط بين النقاط (المهام الفرعية الخمس).
  2. الرياضيات: حتى عندما يعرف ما يجب فعله، فإنه يعاني مع العمليات الحسابية والمنطق المعقد المطلوب لبناء الإجابة النهائية (مثل استخدام وظائف متقدمة أو تنظيم البيانات بشكل صحيح).

الخلاية

تخلص الورقة البحثية إلى أنه لا يمكننا الاستمرار في تدريب الذكاء الاصطناعي على قواعد بيانات نظيفة وتدريبية. لبناء ذكاء اصطناعي يمكنه العمل فعلياً في الشركات الحقيقية، نحتاج إلى التوقف عن التظاهر بأن البيانات نظيفة. BEAVER هو اختبار جديد وأكثر صعوبة يجبر مطوري الذكاء الاصطناعي على إصلاح هذه المشكلات المحددة والفوضوية قبل أن يمكن الوثوق بأدواتهم في العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →