← أحدث الأبحاث
🤖 AI

Citation-Closure Retrieval and Per-Rule Attribution for Real-World Regulatory Compliance Question Answering

تقدم هذه الورقة RefWalk، وهو إطار عمل موحد مصمم لتعزيز الإجابة على أسئلة الامتثال التنظيمي من خلال فرض الإسناد لكل قاعدة وعمليات البحث الإجرائية المهيكلة، والذي تم التحقق من صحته من خلال معيار RegOps-Bench الجديد ومجموعة بيانات الامتثال الصحي في الولايات المتحدة.

المؤلفون الأصليون: Yeong-Joon Ju, Seong-Whan Lee

نُشر 2026-05-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yeong-Joon Ju, Seong-Whan Lee

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول التنقل في مكتبة ضخمة متعددة الطوابق، حيث لا تكتفي الكتب بالجلوس على الرفوف فحسب؛ بل هي مرتبطة ببعضها البعض بواسطة خيوط غير مرئية. إذا التقطت كتاباً بعنوان "كيفية بناء جسر"، فقد تجد ملاحظة تقول: "انظر الفصل الرابع من كتاب 'قواعد السلامة'"، والذي بدوره يشير إلى فقرة محددة في كتاب "تصريح المدينة"، والذي يشير أخيراً إلى حاشية صغيرة في "دليل الإنشاءات".

هذا هو بالضبط ما يشبهه الامتثال التنظيمي (Regulatory Compliance) بالنسبة للشركات. يتعين عليهم اتباع قواعد صارمة ومتعددة الطبقات (قوانين، مراسيم، أدلة) تشير باستمرار إلى بعضها البعض. وإذا أخطأوا، فقد يواجهون غرامات باهظة.

تشير الورقة البحثية إلى أن أدوات الذكاء الاصطناعي الحالية (النماذج اللغوية الكبيرة - LLMs) سيئة جداً في هذه المهمة المحددة. فهي تشبه طالباً يقرأ الكتاب الأول، ثم يخمن الإجابة، ثم يخترع رقم صفحة وهمي للاستشهاد به كدليل. إنها سريعة، لكنها خطيرة لأنها "تهلوس" (تكذب) بشأن مصدر القواعد.

إليك حل الورقة البحثية، مقسماً إلى مفاهيم بسيطة:

1. المشكلة: الخريطة "المسطحة" مقابل المتاهة "ثلاثية الأبعاد"

معظم أنظمة الذكاء الاصطناعي تتعامل مع المكتبة كقائمة مسطحة. فهي ترى كلمتي "جسر" و"سلامة" وتفكر: "حسناً، هذان الشيئان مرتبطان". لكنها تغفل عن الهيكل.

  • الواقع: في القانون، القاعدة لا "ترتبط" بقاعدة أخرى فحسب؛ بل هي تفوّض إليها. قاعدة تقول: "افعل (س)، ما لم ينص مرسوم السلامة على (ص)".
  • الفشل: يحاول الذكاء الاصطناعي الحالي إيجاد الإجابة من خلال البحث عن كلمات متشابهة، مما يجعله يفتقد "الخيوط" المحددة التي تربط القواعد ببعضها. كما أنه يعامل الإجابة النهائية والاستشهاد كشيئين منفصلين، وغالباً ما يلحق استشهاداً مزيفاً بنهاية الجملة بعد انتهاء الأمر.

2. الأداة الجديدة: "RefWalk" (الجولة الموجهة)

قام المؤلفون ببناء نظام جديد يسمى RefWalk. تخيله كمرشد سياحي منظم للغاية، لا يكتفي بقراءة الكتب فحسب، بل يسير فعلياً عبر الخيوط التي تربط بينها.

  • "مرساة الموضوع" (The Topic Anchor): عندما تطرح سؤالاً (على سبيل المثال: "هل يمكنني إنفاق مبال_إضافية على الأبحاث الخارجية؟")، لا يقوم RefWalk بمجرد البحث عن الكلمات. بل يفكك السؤال إلى "مفتاح خريطة": من الذي يسأل؟ كم من المال؟ متى؟ وتحت أي ظرف؟
  • "البحث من ثلاث زوايا": بدلاً من البحث عن الإجابة بطريقة واحدة فقط، ينظر المرشد إلى المكتبة من ثلاث زوايا:
    1. الرؤية الضيقة: البحث عن الكلمات الدقيقة التي استخدمتها.
    2. الرؤية الواسعة: البحث عن المفهوم العام، مع تجاهل الكلمات المحددة (في حال صغت سؤالك بشكل غريب).
    3. الرؤية المتوسطة: مزيج من كليهما.
    • لماذا؟ أحياناً تقودك الكلمات الدقيقة إلى الكتاب الخطأ، لكن الفكرة العامة تقودك إلى الكتاب الصحيح. يستخدم RefWalk نظام "تصويت" خاص (يسمى RRM) يختار أفضل نتيجة من أي من الرؤى الثلاث، بدلاً من أخذ المتوسط (الذي قد يؤدي إلى تمييع الإجابة الصحيحة).

3. "مخطط المعرفة" (خريطة الخيوط)

أنشأ المؤلفون مخططاً خاصاً للمكتبة يسمى مخطط المعرفة التشغيلية (OKG).

  • بدلاً من ربط الكتب ببعضها حسب الموضوع فقط، يربط هذا المخطط بينها من خلال المنطق القانوني. فهو يعرف أن "القاعدة أ" تفوّض "القاعدة ب"، وأن "القاعدة ب" تُعرّف "القاعدة ج".
  • يتبع RefWalk هذه الخيوط. فإذا سألت عن الميزانية، يبدأ من قاعدة الميزانية، ثم يتبع الخيط إلى قاعدة السلامة، ثم إلى الدليل، لضمان عدم تفويت أي حلقة في السلسلة.

4. "JSON الصارم" (قاعدة عدم الكذب)

هذا هو الجزء الأهم. في الذكاء الاصطناعي العادي، يكتب النموذج فقرة ثم يحاول إضافة استشهاد في نهايتها. الأمر يشبه كتابة مقال ثم اختراع حاشية سفلية لتبدو ذكياً.

  • نهج RefWalk: يُجبر الذكاء الاصطناعي على ارتداء "سترة تقييد" (تنسيق JSON صارم). لا يمكنه كتابة جملة ما لم يقم أولاً باختيار القاعدة المحددة (المفتاح/Key) ثم كتابة الادعاء كـ "قيمة" (Value) مرتبطة بتلك القاعدة.
  • المجاز: تخيل قاعة محكمة حيث لا يمكن للمحامي نطق كلمة واحدة ما لم يكن ممسكاً بالصفحة المحددة من القانون التي يستشهد بها. لا يمكنه أن يقول: "القانون يقول (س)، وبالمناسبة، هذا من الصفحة 42". بل يجب أن يقول: "الصفحة 42 تقول (س)". هذا يجبر الذكاء الاصطناعي على أن يكون صادقاً؛ فإذا لم يجد الصفحة، فلا يمكنه تقديم الادعاء.

5. الاختبار: "RegOps-Bench"

لإثبات نجاح ذلك، أنشأ المؤلفون اختباراً جديداً يسمى RegOps-Bench.

  • أخذوا لوائح حكومية كورية حقيقية ومعقدة (وهي مشهورة بتعقيدها وتعدد طبقاتها).
  • وضعوا 250 سؤالاً صعباً يتطلب تتبع "خيوط" متعددة عبر كتب مختلفة.
  • النتيجة: تعثرت أنظمة الذكاء الاصطناعي القديمة أو قدمت استشهادات مزيفة. بينما نجح RefWalk في تتبع الخيوط، والعثور على الصفحات الدقيقة، وربط الإجابات بالقواعد الصحيحة. لقد كان أفضل بكثير في إيجاد كل القواعد الضرورية (الاستدعاء/Recall) والتأكد من أن الاستشهادات حقيقية (الدقة/Precision).

ملخص

تقول الورقة البحثية: "الذكاء الاصطناعي بارع في الدردشة، لكنه سيء في تتبع السلاسل القانونية الصارمة".
لقد بنوا RefWalk، وهو نظام:

  1. يرسم الخيوط بين القواعد (ليس فقط الكلمات).
  2. يبحث من ثلاث زوايا لضمان عدم تفويت أي شيء.
  3. يجبر الذكاء الاصطناعي على الاستشهاد قبل التحدث، مما يضمن لصق كل ادعاء بمصدره.

هذا يجعل الذكاء الاصطناعي آمناً بما يكفي للاستخدام في الوظائف عالية المخاطر مثل التحقق مما إذا كانت الشركة تتبع القانون، حيث يمكن أن يؤدي الاستشهاد المزيف إلى دعوى قضائية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →