← أحدث الأبحاث
💻 computer science

SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures

تقدم الورقة البحثية SOP-Maze، وهو معيار مرجعي جديد مستمد من بيانات أعمال واقعية، والذي يقيم النماذج اللغوية الكبيرة في إجراءات التشغيل القياسية المعقدة عبر تصنيف المهام إلى تحديات استدلال جانبي وعميق، مما يكشف عن معاناة كبيرة في حالات "العمى المساري"، و"الهشاشة الحوارية"، و"أخطاء الحساب" عبر النماذج المتطورة.

المؤلفون الأصليون: Jiaming Wang, Zhe Tang, Zehao Jin, Hefei Chen, Yilin Jin, Peng Ding, Xiaoyu Li, Xuezhi Cao

نُشر 2026-01-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiaming Wang, Zhe Tang, Zehao Jin, Hefei Chen, Yilin Jin, Peng Ding, Xiaoyu Li, Xuezhi Cao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم روبوت ذكي جداً ومثقف كيفية أداء وظيفة محددة، مثل العمل كوكيل خدمة عملاء أو بائع. أنت تعطيه كتاب قواعد سميكاً يسمى إجراء التشغيل القياسي (SOP). هذا ليس مجرد قائمة بسيطة من "افعل هذا، ثم افعل ذاك"، بل هو متاهة معقدة تحتوي على مئات من فروع "إذا-إذن"، تشبه كتب "اختر مغامرتك الخاصة" حيث تؤدي أي خطوة خاطئة إلى طريق مسدود.

تقدم ورقة البحث "SOP-Maze" طريقة جديدة لاختبار ما إذا كانت هذه الروبوتات الذكية قادرة حقاً على التنقل عبر كتب قواعد الأعمال الواقعية هذه دون أن تضل طريقها.

إليك تفصيل بسيط لما قام به الباحثون وما وجدوه:

1. الاختبار الجديد: SOP-Maze

قام الباحثون ببناء "صالة تدريب" لنماذج الذكاء الاصطناعي تسمى SOP-Maze.

  • المصدر: بدلاً من اختراع قواعد وهمية، أخذوا 300,000 سجل حقيقي من سجلات الأعمال الداخلية لإحدى الشركات. قاموا بتنقيحها لإنشاء 397 سيناريو واقعياً (مثل مكالمة مبيعات أو شكوى عميل) تحتوي على 3,422 خطوة صغيرة.
  • الهدف: معرفة ما إذا كان بإمكان الذكاء الاصطناعي قراءة كتاب قواعد طويل ومعقد، والاستماع إلى محادثة بشرية مليئة بالضجيج، واتباع المسار الدقيق المطلوب للوصول إلى الإجابة الصحيحة.

2. نوعان من المتاهات

أدرك الباحثون أن قواعد الأعمال تأتي بنوعين، لذا قسموا الاختبار إلى فئتين (باستخدام استعارة النباتات):

  • نظام الجذور الجانبية (LRS) – المتاهة "العريضة":
    • الاستعارة: تخيل شجرة ذات جذع ضحل ولكن لديها مئات الفروع التي تنتشر على اتساع كبير.
    • التحدي: يتعين على الذكاء الاصطناعي اختيار الفرع الصحيح الواحد من بين احتمالات عديدة. الأمر يشبه الوقوف عند مفترق طرق به 10 لوحات إرشادية مختلفة، وعليك اختيار المسار الصحيح فوراً. إذا اخترت المسار الخاطئ، فستعلق هناك.
  • نظام الجذور القلبية (HRS) – المتاهة "العميقة":
    • الاستعارة: تخيل شجرة ذات نظام جذور عميق وملتوٍ يمتد بعيداً تحت الأرض.
    • التحدي: يتعين على الذكاء الاصطناعي اتباع سلسلة منطقية طويلة ومعقدة. يجب أن تحدث الخطوة (أ) قبل الخطوة (ب)، والتي يجب أن تسبق الخطوة (ج). إذا نسي الذكاء الاصطناعي خطوة حدثت قبل 10 دقائق من المحادثة، فإن السلسلة بأكملها تنكسر.

3. النتائج: الروبوتات تضل طريقها

اختبر الباحثون 18 نموذجاً من أذكى نماذج الذكاء الاصطناعي المتاحة (بما في ذلك أفضل النماذج من OpenAI وAnthropic وغيرها). كانت النتائج مفاجئة: معظمها واجه صعوبة.

حتى النماذج "الأذكى" لم تستطع اتباع قواعد العمل بدقة. ووجد الباحثون ثلاثة أسباب رئيسية لفشل الروبوتات:

أ. عَمى المسار (الضياع في الخريطة)

  • المشكلة: الذك الذكاء الاصطناعي يرى الخريطة لكنه لا يستطيع اتباع المسار.
  • في المتاهة العريضة: يشعر بالارتباك بسبب كثرة الخيارات ويختار الفرع الخاطئ في وقت مبكر، ثم يرفض تصحيح مساره.
  • في المتاهة العميقة: يفقد صبره و"يتخطى الخطوات". يفترض أنه قد أتم بالفعل خطوة لم يقم بها بعد، مما يؤدي إلى استنتاج خاطئ.

ب. الهشاشة الحوارية (الفشل في الدردشة البشرية)

  • المشكلة: الذكاء الاصطناعي حرفي للغاية ولا يستطيع التعامل مع فوضى الكلام البشري الحقيقي.
  • الدقة: البشر يغيرون آراءهم، أو يستخدمون السخرية، أو يقاطعون أنفسهم.
    • مثال: قد يبدأ المستخدم غاضباً ("سأقدم شكوى!") ثم يهدأ ("لا يهم، سأتجاوز الأمر"). غالباً ما يتجاهل الذكاء الاصطناعي هذا التغيير ويستمر في التصرف بغضب.
    • مثال: قد يقول المستخدم، "ها ها، نعم، بالتأكيد" بسخرية. يأخذ الذكاء الاصطناعي الكلمة كـ "نعم" حقيقية ويمضي في إجراء خاطئ.

ج. أخطاء حسابية (سوء الحساب في السياق)

  • المشكلة: الذكاء الاصطناعي سيء في إجراء عمليات حسابية بسيطة أو حسابات زمنية عندما تكون مدفونة داخل محادثة طويلة.
  • الدقة: إذا سألت، "كم دقيقة مرت بين الساعة 1:00 ظهراً و1:05 ظهراً؟" فسيجيب بشكل صحيح. ولكن إذا كان هذا السؤال مخفياً داخل محادثة مكونة من 20 دورة حول تأخير في التسليم، فإن الذكاء الاصطناعي غالباً ما ينسى النظر إلى الطوابع الزمنية أو يخطئ في الحساب.

4. الخلاصة

تخلص الورقة البحثية إلى أنه بينما يمكن لنماذج الذكاء الاصطناعي كتابة القصائد أو الإجابة على الأسئلة العامة، إلا أنها حالياً ليست موثوقة بما يكفي للعمل كوكلاء مهنيين في بيئات الأعمال المعقدة. فهي تفتقر إلى "ذاكرة العضلات" اللازمة لاتباع إجراءات صارمة متعددة الخطوات دون أن تتشتت بخصوصيات المحادثة البشرية أو ترتكب أخطاء منطقية بسيطة.

لقد جعل المؤلفون بيانات الاختبار والتعليمات البرمجية الخاصة بهم (SOP-Maze) متاحة للجمهور حتى يتمكن باحثون آخرون من استخدامها لبناء ذكاء اصطناعي أفضل وأكثر موثوقية يمكنه حقاً اتباع قواعد العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →