← أحدث الأبحاث
💬 NLP

MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents

تقدم الورقة البحثية إطار عمل MANTRA، الذي يقوم تلقائياً بتوليف والتحقق رسمياً من معايير قياس الامتثال القابلة للتوسع والقابلة للفحص آلياً لوكلاء النماذج اللغوية الكبيرة (LLMs) المستخدمة للأدوات، وذلك عبر توليد نماذج عالم رمزية وفحوصات على مستوى التتبع مدعومة ببرمجيات التحقق من النماذج (SMT) من أدلة إجرائية مكتوبة بلغة طبيعية.

المؤلفون الأصليون: Ashwani Anand, Ivi Chatzi, Ritam Raha, Anne-Kathrin Schmuck

نُشر 2026-05-08
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ashwani Anand, Ivi Chatzi, Ritam Raha, Anne-Kathrin Schmuck

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً ومفيداً (وكيل ذكاء اصطناعي) يمكنه استخدام الأدوات للقيام بمهام من أجلك، مثل حجز الرحلات الجوية، أو طلب قطع غيار، أو إدارة سجلات المرضى. ومع ذلك، يعمل هذا الروبوت في بيئة مكتبية صارمة حيث يجب عليه اتباع كتاب قواعد ضخم مكون من 50 صفحة مكتوب باللغة الإنجليزية العادية.

ما هي المشكلة؟ كتاب القواعد مكتوب للبشر، لكن الروبوت يتحدث بلغة "استدعاءات الأدوات" (الأوامر الرقمية). لذا، فإن التحقق مما إذا كان الروبوت قد اتبع القواعد يشبه محاولة تقييم مقال طالب من خلال النظر فقط إلى مسودات أفكاره، دون معرفة ما إذا كان قد اتبع تعليمات المعلم بالفعل.

الحل: MANTRA
ابتكر مؤلفو هذه الورقة نظاماً يسمى MANTRA (الترجمة من الدليل إلى الاختبار). فكر في MANTRA كـ مراقب جودة آلي وصارم للغاية يقوم ببناء "تجربة قيادة" لهؤلاء المساعدين الآليين.

إليك كيف يعمل، باستخدام تشبيه بسيط:

1. الوصفة والطاهي

  • كتاب القواعد (الدليل): تخيل وصفة معقدة لتحضير "السوفليه" تقول: "إذا كانت البيض طازجاً، اخفقه؛ وإذا لم يكن كذلك، اشترِ المزيد. لا تفتح باب الفرن أبداً قبل مرور 20 دقيقة".
  • الروبوت (الوكيل): هذا هو الطاهي الذي يحاول تحضير السوفليه.
  • المشكلة: كيف تعرف ما إذا كان الطاهي قد اتبع الوصفة؟ هل فحص البيض أولاً؟ هل استرق النظر داخل الفرن في وقت مبكر جداً؟

2. بناء الاختبار (نموذج العالم)

بدلاً من مجرد سؤال إنسان لقراءة الوصفة ثم مراقبة الطاهي (وهو أمر بطيء وعرضة للخطأ البشري)، يقوم MANTRA بشيء ذكي. يأخذ الوصفة وقائمة الأدوات التي يمتلكها الطاهي (المضرب، الفرن، المؤقت) ويبني تلقائياً محاكاة رقمية للمطبخ.

  • نموذج العالم: هذا هو التوأم الرقمي للقواعد. هو يعرف أنه: "إذا لم يكن البيض طازجاً، فلا يمكن استخدام أداة المضرب بعد".
  • عمليات التحقق: يقوم MANTRA أيضاً بتوليد قائمة بأشياء محددة للبحث عنها، مثل: "هل فحص الطاهي البيض قبل خفقه؟"

3. "المحقق الرياضي" (حل SMT)

هذا هو الجزء السحري. بما أن الوصفة وقائمة التحقق قد كُتبتا بواسطة ذكاء اصطناعي (والذي قد يرتكب أحياناً أخطاء أو يهلوِس)، فإن MANTRA لا يثق بهما فحسب. بل يستخدم محرك منطق رياضي (يسمى حل SMT) ليعمل كـ "محقق رياضي".

  • التحقق المتقاطع: يسأل المحقق: "هل هناك أي طريقة تجعل الطاهي يتبع قائمة (التحققات) ولكنه يكسر قواعد (نموذج العالم)؟"
  • حلقة الإصلاح: إذا وجد المحقق ثغرة (على سبيل المثال: قائمة التحقق تقول "اخفق البيض" بينما نموذج العالم يقول "يجب فحص البيض أولاً")، فإنه يقوم بإصلاح الاختبار تلقائياً. يستمر في القيام بذلك حتى يصبح الاختبار مثالياً من الناحية الرياضية.
  • الدعم البشري: فقط إذا تعثر المحقق الرياضي، يتدخل الإنسان لإصلاح التفاصيل النهائية.

4. النتيجة: امتحان مثالي

المنتج النهائي هو مجموعة اختبارات مرجعية (Benchmark Suite). وهي عبملة من 285 "سؤال امتحان" مختلف عبر 6 مجالات مختلفة (مثل حجز الطيران، وسلامة المستشفيات، وطلب الأجهزة).

  • التقييم الحتمي: على عكس الاختبارات الأخرى حيث يتعين على إنسان أو ذكاء اصطناعي آخر التخمين فيما إذا كان الروبوت قد أدى عملاً جيداً، فإن اختبارات MANTRA تشبه ورقة الإجابة (Scantron) متعددة الخيارات. فإما أن يتبع الروبوت التسلسل الدقيق لاستدعاءات الأدوات المطلوبة، أو أنه لم يفعل. لا يوجد مجال للتخمين.
  • إيجاد الأعطال: عندما اختبر المؤلفون 6 نماذج مختلفة من الذكاء الاصطناوي على هذه الاختبارات، وجدوا أن معظم الروبوتات فشلت لأنها تجاوزت خطوات "القراءة". على سبيل المثال، كانوا يحاولون "كتابة" طلب شراء قبل "التحقق" مما إذا كان الصنف متوفراً في المخزن. لقد رصدت اختبارات MANTORE التفصيلية هذه الأخطاء المحددة، موضحةً بدقة أين كانت الروبوتات تخفق.

باخت ملخص

MANTRA هو إطار عمل يحول كتب القواعد البشرية الفوضوية إلى اختبارات نظيفة ومحققة رياضياً لوكلاء الذكاء الاصطناعي. إنه يستخدم حلقة "التوليد، والتحقق المتقاطع، والإصلاح" لضمان أن الاختبارات عادلة ودقيقة، مما يسمح لنا بمعرفة ما إذا كان وكلاء الذكاء الاصطناعي يتبعون القواعد حقاً أم أنهم يرتجلون فقط.

الفكرة الجوهرية: تماماً كما لا تثق في سيارة ذاتية القيادة دون اختبارات تصادم صارمة ومحققة رياضياً، لا ينبغي لك الوثوق في ذكاء اصطناعي يستخدم الأدوات دون نظام مثل MANTRA للتحقق من اتباعه للدليل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →