← أحدث الأبحاث
💬 NLP

Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG

تقدم الورقة البحثية Corpus2Skill، وهي طريقة تحول مجموعات الوثائق إلى أشجار مهارات هرمية وقابلة للتنقل لتمكين وكلاء النماذج اللغوية الكبيرة من الاستكشاف والاستنتاج بنشاط حول هياكل المعرفة المؤسسية، مما يؤدي إلى التفوق على النهج التقليدية القائمة على الاسترجاع في معايير اختبار الأسئلة والأجوبة.

المؤلفون الأصليون: Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

نُشر 2026-04-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة البحث "Don't Retrieve, Navigate" (لا تسترجع، بل تصفّح) باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.

الفكرة الكبرى: توقف عن البحث، وابدأ في الاستكشاف

تخيل أنك محقق يحاول حل لغز في مكتبة ضخمة وفوضوية.

الطريقة القديمة (RAG التقليدي):
تسأل أمين المكتبة: "أين الكتاب الذي يتحدث عن تغيير نشاطي التجاري من مؤسسة فردية إلى شركة ذات مسؤولية محدودة (LLC)؟"
يركض أمين المكتبة إلى الخلف، ويحضر لك أفضل 5 كتب تحتوي على كلمات مثل "LLK" أو "تجارة" على غلافها، ويسلمها لك.

  • المشكلة: تحصل على خمسة كتب. أحدهم عن الضرائب، وآخر عن فتح حساب بنكي، والثالث عن النماذج القانونية. لا يوجد أي منها يخبرك فعلياً كيف تغير نوع عملك لأن تلك القاعدة المحددة مخبأة في قسم آخر من المكتبة. عليك قراءة الكتب الخمسة، وتخمين أيها يهمك، والأمل في أنك لم تفوت الإجابة الحقيقية. أنت هنا مستهلك سلبي لما وجده أمين المكتبة.

الطرقة الجديدة (CORPUS2SKILL):
بدلاً من تسليمك كتباً عشوائية، تعطيك المكتبة خريطة مفصلة ومنظمة للمبنى بأكمله قبل أن تبدأ بالبحث.

  • ترى لوحة كبيرة مكتوب عليها: "الأعمال والتمويل".
  • تتوجه إلى هناك لتجد لوحة: "تغييرات الكيان القانوني".
  • تمشي في ذلك الممر وتجد لوحة: "تغيير أنواع الأعمال".
  • أخيراً، تجد الباب المحدد الذي يحتوي على الإجابة.

إذا مشيت في الممر الخطأ (مثل "النماذج الضريبية")، ستدرك فوراً: "أوه، هذا ليس صحيحاً"، ثم تعود أدراجك لتجربة مسار مختلف. أنت هنا مستكشف نشط يمتلك خريطة.


كيف يعمل الأمر: تشبيه "الطبخ"

تصف الورقة عملية مكونة من خطوتين: التجميع/التحضير (الطبخ) والتقديم (الأكل).

1. مرحلة التجميع (الشيف يجهز الوجبة)

قبل أن يسأل أي شخص أي سؤال، يقوم النظام بأخذ كومة فوضوية من أكثر من 6000 وثيقة (مثل حقيبة ضخمة من المكونات المختلطة) وينظمها.

  • التجميع (Clustering): يقوم بتجميع الوثائق المتشابهة معاً (مثل وضع كل "الخضروات" في صندوق واحد و"التوابل" في صندوق آخر).
  • التلخيص (Summarizing): لكل مجموعة، يكتب بطاقة ملخص قصيرة (مثل ملصق على الصندوق يقول "توابل: فلفل، كمون، ملح").
  • بناء الشجرة: ينشئ تسلسلاً هرمياً.
    • المستوى 1: فئات كبرى (مثل "المدفوعات"، "التسويق").
    • المستوى 2: فئات فرعية (مثل "بطاقات الائتمان"، "تحسين محركات البحث SEO").
    • المستوى 3: وثائق محددة.
  • النتيجة: يتم حفظ "شجرة مهارات" نظيفة وقابلة للتصفح (مثل مخزن منظم جيداً). يحدث هذا مرة واحدة، بشكل غير متصل (offline).

2. مرحلة التقديم (الزبون يطلب الطعام)

عندما يطرح المستخدم سؤالاً، لا يقوم وكيل الذكاء الاصطناي (AI Agent) بالبحث في قاعدة بيانات. بل هو يقرأ القائمة.

  • الخطوة 1: يرى الوكيل الفئات الرئيسية. "ممم، المستخدم سأل عن تغيير أنواع الأعمال. هذا يبدو متعلقاً بـ 'المدفوعات' أو 'القانون'".
  • الخطوة 2: يفتح مجلد "المدفوعات" ويقرأ الملخص. "آه، هناك مجلد فرعي يسمى 'إدارة الحسابات'".
  • الخطوة 3: يفتح ذلك المجلد، ويرى قائمة بمقالات محددة، ويختار المقال الذي يحمل عنوان "تغيير نوع عملك التجاري".
  • الخطوة 4: يقرأ ذلك المقال الوحيد ويعطي الإجابة.

إذا أدرك الوكيل أن مسار "المدفوعات" خاطئ، يمكنه إغلاق ذلك المجلد وفتح مجلد "القانون" بدلاً من ذلك. لديه القدرة على اتخاذ القرار (Agency).


لماذا يعد هذا أفضل؟

اختبرت الورقة هذا الأسلوب على معيار حقيقي لدعم العملاء (WixQA) ووجدت أنه تفوق على الطرق القديمة في ثلاث نقاط رئيسية:

  1. إنه يرى "الغابة": البحث التقليدي يرى فقط "الأشجار" (الوثائق الفردية). أما هذا النظام فيرى الغابة بأكملها. إذا كان السؤال يشمل موضوعين (مثل "كيف أغير عملتي لدرسي عبر الإنترنت؟")، يمكن للوكيل النظر في مجلد "الدورة التدريبية"، وإدراك أن الإجابة ليست هناك، ثم النظر في مجلد "الفواتير" لدمج الجزئين من المعلومات.
  2. يمكنه التراجع: إذا سلك الوكيل طريقاً مسدودًا، سيعرف أنه طريق مسدود لأن الملخص أخبره بذلك. يمكنه الالتفاف وتجربة مسار آخر. البحث التقليدي يعطيك الإجابة الخاطئة وعليك أنت أن تخمن.
  3. لا يوجد "صندوق أسود": في البحث التقليدي، لا يعرف الذكاء الاصطناي لماذا اختار وثيقة معينة. في هذا النظام، يعرف الوكيل تماماً من أي مجلد جاء ولماذا اختار هذا المسار.

المقايضة: التكلفة مقابل الجودة

  • التكلفة: تستخدم هذه الطريقة المزيد من "الرموز/Tokens" (قوة الحوسبة) لكل سؤال لأن الذكاء الاصطناعي عليه قراءة ملخصات المجلدات أثناء التنقل. الأمر يشبه قراءة القائمة قبل الطلب، مما يستغرق بضع ثوانٍ.
  • الفائدة: الإجابات أكثر دقة وواقعية بكثير. بالنسبة للأسئلة التجارية المعقدة حيث يكون الخطأ مكلفاً (مثل النصائح القانونية أو الفواتير)، فإن التكلفة الإضافية تستحق العناء.

تشبيه الملخص

  • الـ RAG التقليدي يشبه سؤال شخص عشوائي في الشارع عن الاتجاهات. قد يدلك على الشارع الصحيح، أو قد يدلك على طريق مسدود لأنه لا يعرف سوى بضعة شوارع فقط.
  • CORPUS2SKILL يشبه إعطاء المسافر جهاز GPS مع خريطة كاملة للمدينة. يمكنه رؤية المسار بأكمله، واختيار أفضل طريق، وإذا أخطأ في الطريق، يمكنه رؤية الخريطة فوراً وتغيير مساره.

الرسالة الرئيسية للورقة بسيطة: لا تكتفِ بجعل الذكاء الاصطناعي يبحث عن الإجابات فحسب. بل أعطه خريطة حتى يتمكن من التنقل للوصول إليها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →