← أحدث الأبحاث
🤖 AI

U-Define: Designing User Workflows for Hard and Soft Constraints in LLM-Based Planning

تقدم هذه الورقة نظام U-Define، الذي يعزز تحكم المستخدم في التخطيط القائم على النماذج اللغوية الكبيرة من خلال السماح للمستخدمين بتصنيف القيود إما كقواعد "صارمة" (hard) أو تفضيلات "مرنة" (soft)، والتي يتم التحقق منها عبر طرق مكملة لتدقيق النماذج الرسمية واستخدام النموذج اللغوي الكبير كحَكَم (LLM-as-judge) لتحسين الموثوقية، وسهولة الاستخدام، ورضا المستخدم.

المؤلفون الأصليون: Christine P Lee, Xinyu Jessica Wang, Aws Albarghouthi, David Porfirio, Bilge Mutlu

نُشر 2026-05-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Christine P Lee, Xinyu Jessica Wang, Aws Albarghouthi, David Porfirio, Bilge Mutlu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول التخطيط لرحلة عائلية مثالية. لديك قائمة بأشياء يجب أن تحدث (مثل "يجب أن نبقى ضمن ميزانيتنا" أو "يجب على الأطفال ارتداء سترات النجاة في المسبح") وأشياء تأمل حقاً حدوثها (مثل "نود الحصول على شاطئ هادئ" أو "سيكون من الجيد رؤية متحف").

في الماضي، عندما كان الناس يطلبون من الذكاء الاصطناعي (النماذج اللغوية الكبيرة) التخطيط لهذه الرحلة، كان الذكاء الاصطناعي يكتفي بالتخمين فقط. قد ينسى سترات النجاة لأنه كان مشغولاً جداً بمحاولة أن يكون مبدعاً، أو قد يقترح فندقاً يكلف الكثير من المال. الذكما الاصطناعي هنا يشبه وكيل سفر موهوباً جداً، ولكنه مشتت الذهن قليلاً، يتحدث بطلاقة ولكنه لا يستمع دائماً إلى القواعد الصارمة.

المشكلة:
أدوات الذكاء الاصطناعي الحالية إما أنها جامدة للغاية (تجبرك على استخدام أكواد معقدة لوضع القواعد) أو فضفاضة للغاية (تتجاهل قواعدك تماماً). كان المستخدمون عالقين في عملية التحقق اليدوي من عمل الذكاء الاصطناعي، وهو أمر مرهق وعرضة للخطأ.

الحل: U-Define
قام الباحثون ببناء نظام جديد يسمى U-Define. فكر فيه كـ "وكيل سفر ذكي مع نظام للتدقيق المزدوج". بدلاً من مجرد سؤال الذكاء الاصطناعي عن "تخطيط رحلة"، يتيح لك U-Define إخبار الذكاء الاصطناعي بالضبط أي القواعد هي قواعد صارمة (Hard) وأيها قواعد مرنة (Soft).

إليك كيف يعمل، باستخدام تشبيهات بسيطة:

1. دلوَا القواعد

يطلب منك U-Define فرز تعليماتك في دلوين:

  • دلو "القواعد الصارمة" (الجدار الطوبي): هذه هي القواعد التي لا تقبل التفاوض. إذا كسرها الذكاء الاصطناعي، تصبح الخطة عديمة الفائدة.
    • مثال: "يجب أن نأكل طعاماً نباتياً."
    • السحر: يقوم U-Define بتحويل جملتك باللغة الإنجليزية فوراً إلى "كود" رياضي صارم (يسمى LTL/PRISM) يمكن للكمبيوتر التحقق منه بدقة. الأمر يشبه تحويل قاعدتك إلى كاميرا مراقبة لا ترمش أبداً. إذا تضمنت الخطة قطعة لحم، ستصرخ الكاميرا "خطأ!" فوراً.
  • دلو "القواعد المرنة" (قائمة الأمنيات): هذه هي التفضيلات. إذا لم يحققها الذكاء الاصطناعي، تظل الخطة جيدة، لكنها ليست مثالية.
    • مثال: "نفضل وتيرة استرخاء."
    • السحر: بالنسبة لهذه القواعد، يستخدم U-Define ذكاءً اصطناعياً ثانياً ("القاضي") لقراءة الخطة وإعطائها تقييماً بالنجوم (من 1 إلى 5 نجوم) وتعليقاً حول مدى مطابقتها لأجوائك المفضلة.

2. سير العمل: كيف تتفاعل معه

تخيل أنك تجلس أمام جهاز الكمبيوتر مع U-Define:

  1. أنت تتحدث: تكتب: "خطط لرحلة إلى فينيسيا". تضيف قواعدك الصارمة (سترات النجاة، الطعام النباتي) وقواعدك المرنة (وتيرة مريحة، مرح للأطفال).
  2. المترجم: يقوم النظام سراً بتحويل قواعدك "الصارمة" إلى ذلك الكود الرياضي الصارم. ويظهر لك الترجمة للتأكد من أنه فهمك بشكل صحيح.
  3. المولد: يقوم الذكاء الاصطناعي الرئيسي بإنشاء ثلاث خطط رحلات مختلفة.
  4. التدقيق المزدوج:
    • الكمبيوتر الرياضي يتحقق من القواعد الصارمة. يقول: "الخطة (أ) فشلت لأنها لم تضع سترات النجاة. الخطة (ب) اجتازت جميع القواعد الصارمة."
    • ذكاء "القاضي" الاصطناعي يتحقق من القواعد المرنة. يقول: "الخطة (ب) حصلت على 4 نجوم لأنها كانت مريحة، لكن الخطة (ج) حصلت على 5 نجوم لأنها تضمنت المزيد من الأنشطة الممتعة."
  5. النتيجة: ترى الخطط مرتبة. أنت تعلم يقيناً أن الخطط المتصدرة لن تكسر "أساسياتك"، ويمكنك رؤية أي منها يناسب "رغباتك" بشكل أفضل.

3. ما وجده الباحثون

اختبر الفريق النظام مع أشخاص عاديين (مثل الآباء الذين يخططون للعطلات) وخبراء (مثل مديري الإنشاءات أو منسقي المنح).

  • الأشخاص العاديون أحبوا الأمر: شعروا بثقة أكبر بكثير. لم يضطروا للعب دور "المحقق" للعثور على الأخطاء. أحبوا أنه يمكنهم الفصل بين ما هو "يجب فعله" وما هو "مجرد اقتراح". شعروا أن الذكاء الاصطناعي فهم أخيراً الفرق بين القاعدة والاقتراح.
  • القواعد "الصارمة" قوية: عندما ضمن النظام اتباع القواعد الصارمة، وثق الناس في الذكاء الاصطناعي بشكل أكبر بكثير. كانوا مستعدين لقبول بعض الهفوات البسيطة في القواعد المرنة، ولكن إذا كُسرت قاعدة صارمة، كانوا يشعرون بعدم الرضا الشديد.
  • القواعد "المرنة" مرنة: استخدم الناس القواعد المرنة لتعديل الخطة حتى تبدو مثالية تماماً. ومع ذلك، لاحظوا أن "تقييمات النجوم" التي يعطيها الذكاء الاصطناعي للقواعد المرنة لم تكن دقيقة دائماً، لذا ظلوا بحاجة إلى مراجعة الخطة بأنفسهم.
  • الخبراء أرادوا مزيداً من المساعدة: أحب الخبراء (الذين لديهم وظائف معقدة للغاية) النظام، لكنهم وجدوا صعوبة في كتابة كل قواعدهم الكثيرة. تمنوا لو كان بإمكان النظام تذكر قواعدهم المعتادة أو استيرادها من جداول البيانات حتى لا يضطروا لكتابة كل شيء من الصفر في كل مرة.

الخلاصة الكبرى

خلصت الورقة البحثية إلى أنه لكي يكون الذكاء الاصطناعي مفيداً حقاً في التخطيط، يجب أن يترك لك القرار بشأن ما هو قاعدة صارمة وما هو تفضيل مرن.

  • القيود الصارمة = أساس المنزل (يجب أن يكون صلباً).
  • القيود المرنة = الطلاء والديكور (يمكن تغييره حسب الذوق).

من خلال منح المستخدمين طريقة واضحة للتمييز بين هذين النوعين واستخدام "أدوات" مختلفة للتحقق منهما (الرياضيات للأشياء الصارمة، وذكاء اصطناعي ثانٍ للأشياء المرنة)، يجعل U-Define التخطيط بالذكاء الاصطناعي أكثر موثوقية دون فقدان إبداعه. إنه يحول الذكاء الاصطناعي من "صندوق أسود" يخمن إلى "شريك تعاوني" يحترم حدودك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →