← أحدث الأبحاث
🤖 AI

OR-Space: A Full-Lifecycle Workspace Benchmark for Industrial Optimization Agents

تقدم الورقة البحثية OR-Space، وهو معيار مساحة عمل كاملة دورة الحياة مصمم لتقييم وكلاء التحسين الصناعي في مهام واقعية متعددة المراحل تتضمن بناء النماذج، والمراجعة، والتفسير المرتكز ضمن بيئات مستمرة ومتعددة المصنوعات، متجاوزاً بذلك تقييمات صياغة المشكلات التقليدية ذات الخطوة الواحدة.

المؤلفون الأصليون: Chenyu Zhou, Xinyun Lu, Jiangyue Zhao, Jianghao Lin, Dongdong Ge, Yinyu Ye

نُشر 2026-05-28
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Chenyu Zhou, Xinyun Lu, Jiangyue Zhao, Jianghao Lin, Dongdong Ge, Yinyu Ye

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك توظف مساعداً عبقرياً جديداً للمساعدة في إدارة مصنع. أنت تريد أن ترى ما إذا كان بإمكانه القيام بالوظيفة فعلياً، وليس مجرد التحدث عنها.

لفترة طويلة، كانت الطريقة التي نختبر بها هؤلاء المساعدين من الذكاء الاصطناائي (الذين يُطلق عليهم اسم "وكلاء LLM") تشبه إعطاءهم بطاقة وصفة مكتوبة بشكل مثالي. تقول البطاقة: "إليك المشكلة، وإليك المكونات، وإليك الصيغة الرياضية. الآن، اكتب الكود البرمجي لحلها".

إذا كتب الذكاء الاصطناعي الكود بشكل صحيح، كنا نمنحه نجمة ذهبية. ولكن في العالم الحقيقي، لا يحصل مديرو المصانع على بطاقات وصفة مثالية. بل يحصلون على مكتب فوضوي مليء بالملاحظات اللاصقة، وجداول البيانات، وأكواد قديمة من العام الماضي، ورسائل بريد إلكتروني من المدير تقول: "أوه، بالمناسبة، نحتاج إلى تغيير القواعد للشهر القادم".

OR-Space هو اختبار أصعب بكثير، صُمم ليرى ما إذا كان بإمكان الذكاء الاصطناعي التعامل مع هذا المكتب الفوضوي.

الطرق الثلاثة التي نختبر بها الذكاء الاصطناعي

يقدم البحث معياراً يسمى OR-Space (فضاء بحوث العمليات). وبدلاً من سؤال واحد، فإنه يعطي الذكاء الاصطناعي "مساحة عمل" كاملة (مجلد رقمي يحتوي على ملفات) ويطلب منه القيام بثلاثة أنواع مختلفة من المهام التي تحدث في مصنع حقيقي:

1. البناء (المعماري):

  • السيناريو: تسلم الذكاء الاصطناعي مجلداً يحتوي على مذكرة عمل، وجدول بيانات بالأرقام، وملف كود فارغ.
  • المهمة: يجب على الذكاء الاصطناعي قراءة المذكرة، وفهم معنى الأرقام، وكتابة برنامج كمبيوتر جديد تماماً لحل مشكلة المصنع من الصفر.
  • العقبة: قد تكون المذكرة غامضة، وقد يكون جدول البيانات ذا أعمدة غير منظمة. يجب على الذكاء الاصطناعي ربط النقاط بين النص والبيانات دون وجود دليل مثالي.

2. المراجعة (المُصلح):

  • السيناريو: لقد غير المصنع رأيه للتو. ربما أصبح لديهم المزيد من الشاحنات الآن، أو قاعدة جديدة تتعلق بالسلامة. يتم إعطاء الذكاء الاصطناعي البرنامج القديم والقواعد الجديدة.
  • المهمة: يجب على الذكاء الاصطناعي تحديث الكود القديم ليتناسب مع القواعد الجديدة دون كسر الأجزاء التي كانت تعمل بالفعل.
  • العقبة: هذا يشبه محاولة ترميم منزل بينما لا يزال الناس يعيشون فيه. إذا قام الذكاء الاصطناعي بنسخ اسم متغير من الكود القديم لم يعد منطقياً، فسيؤدي ذلك إلى تعطل النظام بالكامل. وجد البحث أن بعض نماذج الذكاء الاصطناعي ترتبك بسبب الكود القديم وتحاول نسخ أخطائه، بينما النماذج الأكثر ذكاءً تعرف ما يجب الاحتفاظ به وما يجب التخلص منه.

3. الشرح (المترجم):

  • السيناريو: لقد قام الكمبيوتر بحل المشكلة، لكن مدير المصنع (الذي ليس خبيراً في الرياضيات) يسأل: "لماذا قررت إرسال 5 شاحنات إلى المستودع الشمالي بدلاً من الجنوبي؟"
  • المهمة: يجب على الذكاء الاصطناعي النظر في الحل، والكود، وسجلات البيانات لتقديم إجابة صادقة.
  • العقبة: لا يمكن للذكاء الاصطناعي مجرد اختلاق قصة. يجب عليه الإشارة إلى سطر محدد في جدول البيانات أو قاعدة محددة في الكود هي التي فرضت ذلك القرار. إذا قام بالتخمين، فإنه يخسر النقاط.

لماذا هذا الاختبار مختلف (مفهوم "مساحة العمل" مقابل "المطالبة/البرومبت")

يجادل المؤلفون بأن الاختبارات السابقة كانت تشبه البطاقات التعليمية. تظهر للذكاء الاصطناعي مشكلة نظيفة ومعزولة، فيقوم بالإجابة عليها.

أما OR-Space فهو يشبه مكتباً حقيقياً.

  • الملفات منفصلة: المتطلبات موجودة في مستند Word، والأرقام في ملف CSV، والكود في ملف Python. يجب على الذكاء الاصطناعي فتحها جميعاً، وقراءتها، وإدراك كيف تتكامل مع بعضها البعض.
  • مشكلة "التأصيل" (Grounding): في اختبار البطاقات التعليمية، قد يخمن الذكاء الاصطناعي الإجابة الصحيحة لأنه يتعرف على الكلمات. أما في OR-Space، فإذا لم يربط الذكاء الاصطناعي بشكل صحيح بين كلمة "السعة" (capacity) في المذكرة والعمود "max_load" في جدول البيانات، فسوف يفشل. يطلق البحث على هذا الأمر اسم "التأصيل" (grounding)—أي ربط الكلمات بالبيانات الفعلية.

ما الذي وجدوه (النتائج)

اختبر الباحثون 20 نموذجاً مختلفاً من الذكاء الاصطناعي (الأكثر ذكاءً المتاحة حالياً) في هذا الاختبار الجديد. وإليكم ما حدث:

  • الأمر أصعب مما يبدو: حتى أفضل نماذج الذكاء الاصطناعي واجهت صعوبات. فبينما استطاعت بعضها حل نسخة "البطاقات التعليمية" من المشكلة، إلا أنها غالباً ما فشلت عندما توجب عليها التنقل داخل مجلد الملفات الفوضوي.
  • الكود القديم سلاح ذو حدين: عندما تم إعطاء الذكاء الاصطناعي كوداً قديماً لمساعدته في مراجعة النموذج، أصبحت النماذج الأكثر ذكاءً أفضل لأنها استخدمت الكود القديم كإشارة مساعدة. لكن النماذج الأضعف أصبحت أسوأ لأنها نسخت أخطاء الكود القديم بشكل أعمى (مثل محاولة استخدام متغير لم يعد موجوداً).
  • فجوة "الشرح": كانت بعض النماذج بارعة في كتابة الكود ولكنها سيئة جداً في شرحه. استطاعت حل المسألة الرياضية لكنها لم تستطع إخبارك لماذا اتخذت ذلك القرار بناءً على الملفات المتاحة لها.
  • عقوبة "نظام الملفات": وجد البحث أنه عندما كان على الذكاء الاصطناعي التنقل فعلياً في المجلدات وقراءة الملفات (وضع "نظام الملفات")، كان أداؤه أسوأ مما لو تم لصق نفس المعلومات في كتلة نصية واحدة ضخمة. وهذا يثبت أن إيجاد المعلومات وتنظيمها هي مهارة في حد ذاتها، وليست مجرد مسألة تنسيق.

الخلاصة

يخلص البحث إلى أنه لا يمكننا فقط اختبار الذكاء الاصطناعي على مدى جودة كتابته للكود من "مطالبة" (prompt) مثالية. لكي يكون الذكاء الاصطناعي مفيداً في الصناعات الحقيقية (مثل اللوجستيات، أو التصنيع، أو التمويل)، يجب اختباره على قدرته على:

  1. إيجاد المعلومات الصحيحة وسط كومة من الوثائق الفوضوية.
  2. تحديث الأنظمة القديمة دون كسرها.
  3. شرح قراراته باستخدام أدلة من الملفات الفعلية، وليس مجرد قصص مختلقة.

إن OR-Space هو "اختبار القيادة" الجديد لوكلاء الذكاء الاصطناعي، حيث ينقلهم من ساحة المواقف (المطالبات المثالية) إلى شوارع المدينة المزدحمة (مساحات العمل الحقيقية).

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →