GraphWalker: Agentic Knowledge Graph Question Answering via Synthetic Trajectory Curriculum
يُعد GraphWalker إطار عمل جديد للإجابة على الأسئلة باستخدام الرسوم البيانية للمعرفة القائمة على الوكلاء، وهو يعالج تحديات ندرة بيانات التدريب وتعميم الاستدلال من خلال توظيف نموذج ضبط دقيق ثنائي المراحل يجمع بين التوليف الآلي للمسارات من خلال المشيات العشوائية وبين صقل المسارات بواسطة الخبراء، مما يحقق أداءً هو الأفضل في فئته على مجموعات البيانات المرجعية.
المؤلفون الأصليون:Shuwen Xu, Yao Xu, Jiaxiang Liu, Chenhao Yuan, Wenshuo Peng, Jun Zhao, Kang Liu
تخيل أنك تحاول حل لغز حقيقي ضخم. لديك مكتبة عملاقة وفوضوية (الرسم البياني للمعرفة - Knowledge Graph) تحتوي على المليارات من الكتب، والحقائق، والروابط. هدفك هو الإجابة على سؤال محدد، مثل: "أين كان الملعب الرئيسي للفريق الذي فاز ببطولة العالم لعام 1946؟"
لحل هذا اللغز، تحتاج إلى محقق (وكيل ذكاء اصطناعي - AI Agent) يمكنه التجول في المكتبة، وطلب الأدلة من أمين المكتبة، وقراءة الكتب، وتجميع قطع الحل معاً.
تقدم هذه الورقة البحثية GraphWalker، وهي طريقة تدريب جديدة لتحويل محقق مرتبك وأخرق إلى محقق بارع. إليك كيف يعمل الأمر، مقسماً إلى مفاهيم بسيطة:
المشكلة: "المحقق التائه"
يعاني محققو الذكاء الاصطناعي الحاليون من عيبين رئيسيين:
إنهم جامدون للغاية: بعضهم يتم تعليمه اتباع سيناريو صارم ومكتوب مسبقاً. إذا قال السيناريو "اذهب إلى قسم التاريخ"، ولكن الإجابة موجودة في قسم الرياضة، فإنهم يعلقون في مكانهم. لا يمكنهم الاستكشاف من تلقاء أنفسهم.
يفتقرون إلى الخبرة: البعض الآخر يُعطى فقط بضعة أمثلة لكيفية حل قضية ما. هم يحفظون الأمثلة، لكنهم يصابون بالذعر عندما يواجهون نوعاً جديداً من الألغاز لم يروه من قبل. كما يتشتتون بسهولة بسبب الضجيج في المكتبة (الحقائق غير ذات الصلة) ولا يعرفون كيفية التعافي عندما يصلون إلى طريق مسدود.
الحل: "معسكر تدريب GraphWalker ذو المرحلتين"
ابتكر المؤلفون برنامج تدريب خاصاً يسمى GraphWalker يعلم الذكاء الاصطناعي في مرحلتين متمايزتين، تتبعهما عملية "تدريب ميداني" نهائية.
المرحلة الأولى: "رحلة البحث عن الكنز" (بناء الخريطة)
التشبيه: تخيل إرسال المحقق إلى المكتبة وهو معصوب العينين، ولكن مع قاعدة واحدة: "تحرك بشكل عشوائي، ولكن لا تدخل في طرق مسدودة". أنت تجبرهم على التجول عبر آلاف الممرات المختلفة، وربط حقائق عشوائية ببعضها البعض.
ماذا يحدث: يقوم الذكاء الاصطناعي بتوليد 15,000 "مسار لغز" وهمي ولكن واقعي. يتعلم كيفية التنقل في مخطط المكتبة، مدركاً أنه لكي يجد الإجابة، قد يحتاج إلى الانتقال من "الرياضة" إلى "التاريخ" ثم إلى "الجغرافيا".
النتيجة: يبني الذكاء الاصطناعي خريطة ذهنية واسعة. يتوقف عن الخوف من حجم المكتبة ويتعلم كيفية الاستكشاف بكفاءة دون أن يضيع.
المرحلة الثانية: "تمرين التعافي من الأخطاء" (تعلم التأمل الذاتي)
التشبيه: الآن، يُعطى المحقق مجموعة من 6,000 حالة محددة حيث كاد يحل اللغز لكنه ارتكب خطأً. في هذه السيناريوهات، يدرك المحقق: "أوه لا، لقد سلكت زقاقاً خاطئاً! أحتاج إلى العودة إلى الوراء وتجربة باب آخر".
ماذا يحدث: يتم تدريب الذكاء الاصطناعي على أمثلة "خبيرة" حيث يتعلم كيفية رصد الطرق المسدودة، وإدراك أنه مخطئ، والعودة إلى الوراء (Backtrack) لإيجاد المسار الصحيح.
النتيجة: يطور الذك الذكاء الاصطناعي قدرة على التأمل الذاتي. يتعلم أنه لا بأس في ارتكاب خطأ طالما أنه يعرف كيفية إصلاحه.
المرحلة الثالثة: "التدريب الميداني" (التعلم المعزز)
التشبيه: أخيراً، تضع المحقق في لعبة حقيقية عالية المخاطر. يحصل فقط على نقطة إذا حل اللغز بشكل مثالي. ولأن لديه بالفعل الخريطة (المرحلة 1) ومهارات التعافي (المرحلة 2)، يمكنه الآن التجربة والتعلم بشكل أسرع بكثير من ذي قبل.
النتيجة: يقوم الذكاء الاصطناعي بتحسين استراتيجيته ليصبح أسرع وأدق محقق ممكن.
لماذا يهم هذا الأمر (لحظة الإدراك!)
حاولت معظم الأساليب السابقة تعليم الذكاء الاصطناعي كل شيء دفعة واحدة أو مجرد إعطائه بضعة أمثلة. أما GraphWalker فهو بمثابة منهج دراسي:
أولاً، علمه كيف يستكشف (حتى لا يضيع).
ثانياً، علمه كيف يصلح الأخطاء (حتى لا يستسلم).
ثالثاً، دعه يتنافس (حتى يصبح أفضل).
النتائج
عند اختباره في تحديات الإجابة على الأسئلة الشهيرة، لم يكتفِ GraphWalker بأداء جيد فحسب؛ بل سحق المنافسين.
حل ألغازاً معقدة حيرت نماذج الذكاء الاصطناعي الرائدة الأخرى.
استطاع التعامل مع أسئلة لم يسبق له رؤيتها (التعميم) لأنه تعلم مبادئ التنقل، وليس مجرد الإجابات.
يعمل حتى مع نماذج الذكاء الاصطناዊ الأصغر والأرخص، مما يثبت أن جودة التدريب أهم من مجرد امتلاك "دماغ عملاق".
باخت مستخلص
GraphWalker هو نظام تدريب يعلم وكلاء الذكاء الاصطناعي كيف يكونون مستكشفين فضوليين لا يخشون الضياع، وحلالي مشكلات أذكياء يعرفون كيفية التعافي من أخطائهم. من خلال محاكاة "رحلة بحث عن كنز" تليها "تمارين تصحيح الأخطاء"، فإنه يخلق ذكاءً اصطناعياً يمكنه التنقل في أكبر قواعد المعرفة في العالم بثقة المحقق المتمرس.
إليك ملخص تقني مفصل لورقة البحث: "GraphWalker: وكيل الإجابة على أسئلة الرسوم البيانية المعرفية عبر منهج تعليمي للمسارات الاصطناعية."
1. بيان المشكلة
يهدف الإجابة على أسئلة الرسوم البيانية المعرفية عبر الوكلاء (Agentic KGQA) إلى تمكين النماذج اللغوية الكبيرة (LLMs) من التفاعل بشكل تكراري مع الرسوم البيانية المعرفية (KGs) العالمية للإجابة على الأسئلة المعقدة. وبينما تظل الطرق التقليدية (استرجاع المعلومات والتحليل الدلالي) محدودة بنطاقات ثابتة، تواجه الأساليب القائمة على الوكلاء حالياً عقبتين حرجتين:
ندرة بيانات التدريب: تندر مسارات التفاعل عالية الجودة والمتنوعة اللازمة لتدريب الوكلاء. تعتمد معظم الطرق على التلقين (Prompting) (الذي يفتقر إلى تحديثات المعلمات لضمان الملاحة القوية) أو التدريب على مسارات محددة مسبقاً وضيقة النطاق تفشل في التعميم.
تعميم الاستدلال: غالباً ما تحصر أنابيب التدريب الحالية الاستدلال في سير عمل محدد مسبقاً أو رسوم بيانية فرعية مستخرجة مسبقاً. يعاني الوكلاء من صعوبة في التعامل مع مسارات الاستدلال "خارج التوزيع" (OOD)، وبيئات الرسوم البيانية المعرفية الصاخبة، وتوزيعات الكيانات ذات الذيل الطويل. علاوة على ذلك، غالباً ما يفشل تحسين التعلم التعزيزي (RL) دون وجود سابقة قوية من الضبط الدقيق تحت الإشراف (SFT) لإنشاء قدرة استكشاف متينة.
2. المنهجية: إطار عمل GraphWalker
يقترح GraphWalker إطار عمل مبتكر يعالج هذه المشكلات من خلال تخليق المسارات الآلي ونموذج الضبط الدقيق المرحلي، يليه تعلم تعزيزي خفيف الوزن.
أ. بيئة الوكيل
يتفاعل الوكيل مباشرة مع رسم بياني معرفي عالمي (Freebase) عبر نقطة نهاية SPARQL، بدلاً من الرسوم البيانية الفرعية المستخرجة مسبقاً. وهو يستخدم أداتين أوليتين:
get_relations(e): يسترجع جميع العلاقات المتصلة بكيان ما.
get_triples(e, R'): يسترجع مجموعات محددة من الثلاثيات بناءً على مجموعة فرعية من العلاقات. يعمل الوكيل في حلقة: ملاحظة الحالة ← التفكير (سلسلة الأفك - Chain-of-Thought) ← تنفيذ الإجراء (استعلام أو إجابة) ← تلقي الملاحظة.
ب. خط إنتاج بناء البيانات
يبني إطار العمل مجموعتين من البيانات المتكاملتين لدعم منهج تعليمي من مرحلتين:
GraphSynth-15k (أولوية الاستكشاف):
الهدف: إنشاء أولوية استكشاف واسعة النطاق عبر هياكل متنوعة للرسوم البيانية المعرفية.
الطريقة: يستخدم المسارات العشوائية المقيدة (CRW) على الرسم البياني المعرفي لتوليد 15 ألف مسار استدلال متنوع هيكلياً (بما في ذلك سلاسل متعددة الخطوات ورسوم بيانية تلازمية).
التخليق: يقوم نموذج لغوي كبير بتوليد أسئلة باللغة الطبيعية لهذه المسارات (مع إخفاء الكيانات الوسيطة لمنع التسرب) ويحاكي ردود فعل البيئة.
الطريقة: مجموعة منتقاة من 6 آلاف مسار "خبير" مشتقة من أسئلة معقدة.
الاختيار: يستخدم أخذ العينات بالرفض القائم على النتيجة. يتم الاحتفاظ بالمسارات فقط إذا نجح الوكيل في تصحيح الأخطاء (التراجع عن النهايات المسدودة) وكانت الإجابة النهائية مستندة واقعياً إلى الملاحظات المسترجعة (المطابقة التامة = 1).
ج. نموذج التدريب
يستخدم GraphWalker خط تدريب ثلاثي المراحل:
المرحلة 1 (SFT على GraphSynth): يتم تدريب الوكيل على الـ 15 ألف مسار المتنوعة لتعلم الملاحة القوية، واستدعاء الأدوات، واستراتيجيات الاستكشاف الواسعة تحت ضجيج استرجاع واقعي.
المرحلة 2 (SFT على GraphRoll): يتم ضبط النموذج بدقة على الـ 6 آلاف مسار خبير لتعلم التأمل (تحديد الملاحظات غير المفيدة) والتعافي من الخطأ (التراجع وتصحيح المسار).
مرحلة التعلم التعزيزي (GRPO): مرحلة تعلم تعزيزي خفيفة الوزن باستخدام تحسين السياسة النسبي للمجموعات (GRPO). تستخدم مكافأة مطابقة تامة (EM) متفرقة على مستوى المسار. والأهم من ذلك، يوفر الـ SFT ثنائي المراحل "أولوية استكشاف" قوية، مما يسمح لمكافأة RL المتفرقة بدفع السياسة بفعالية لتجاوز سقف أداء الـ SFT دون الحاجة إلى إشراف وسيط كثيف.
3. المساهمات الرئيسية
تحديد ندرة البيانات: تحدد الورقة غياب المسارات الوكيلة المتنوعة وعالية الجودة كعائق أساسي لتعميم الإجابة على أسئلة الرسوم البيانية المعرفية.
المنهج التعليمي الاصطناعي (GraphSynth & GraphRoll): تقديم مجموعتين من البيانات: مجموعة ضخمة ومتنوعة هيكلياً للاستكشاف (15 ألف) ومجموعة أصغر عالية الجودة للتأمل (6 آلاف).
SFT مرحلي + RL: منهج تعليمي مبتكر حيث يبني المرحلة الأولى اتساع الاستكشاف، وتغرس المرحلة الثانية التصحيح الذاتي، ويقوم الـ RL بتحسين السياسة. هذا الترتيب حاسم؛ فخلط البيانات أو تخطي المراحل يؤدي إلى تدهور الأداء بشكل كبير.
الأداء المتميز (SOTA): يحقق الإطار نتائج قياسية على المعايسات القياسية مع إظهار قدرة قوية على التعميم (Zero-shot) على هياكل الاستدلال غير المرئية.
4. النتائج التجريبية
أُجريت التجارب على CWQ (Complex WebQuestions) و WebQSP، مع تقييمات Zero-shot على GrailQA ومعيار جديد، GraphWalkerBench.
الأداء: يحقق GraphWalker (باستخدام نموذج خلفي 7B) نسبة 79.6% EM على CWQ و 91.5% EM على WebQSP، متفوقاً على طرق التلقين السابقة (مثل ToG و GoG) والنماذج القائمة على التدريب (مثل KG-Agent و KBQA-o1).
المقارنة مع النماذج المملوكة: حتى عند استخدام نماذج قوية مملوكة (مثل GPT-4o-mini و DeepSeek-V3.2) كنماذج خلفية، يتفوق إطار عمل GraphWalker بشكل كبير على نظائره من نوع "IO Prompt" في وضع Zero-shot.
التعميم:
Zero-Shot: يحقق 86.3% EM على GrailQA (تقسيم zero-shot) و 63.5% EM على GraphWalkerBench (هياكل غير مرئية)، مما يثبت أن الوكيل يمكنه التعامل مع مسارات الاستدلال التي لم يراها أثناء التدريب.
دراسات الاستبعاد (Ablation Studies): إزالة المرحلة 1 (GraphSynth) يخفض الأداء بنسبة ~5% EM، مما يؤكد دورها في الاستكشاف. إزالة المرحلة 2 (GraphRoll) تخفض الأداء بنسبة ~9% EM، مما يؤكد دورها في التعافي من الخطأ. إزالة RL تخفض الأداء بنسبة ~10% EM، مما يظهر قيمة تحسين السياسة.
تحليل Pass@k: يُظهر GraphWalker درجات Pass@k أعلى بكثير، مما يشير إلى مساحة بحث فعالة أكبر مقارنة بالنماذج المدربة بدون المنهج التعليمي الاصطناعي.
5. الأهمية
القابلية للتوسع: يوضح النهج أنه يمكن تحقيق إجابة عالية الجودة على أسئلة الرسوم البيانية المعرفية عبر الوكلاء دون الحاجة إلى تعليق بشري هائل، بالاعتماد بدلاً من ذلك على تخليق المسارات الآلي والتعلم المنهجي.
المتانة: من خلال التدريب على الرسم البياني المعرفي العالمي بدلاً من الرسوم البيانية الفرعية، يعد GraphWalker أكثر متانة تجاه الضجيج وتوزيعات الذيل الطويل لقواعد المعرفة في العالم الحقيقي.
كفاءة التعلم التعزيزي (RL): تقدم الورقة دليلاً تجريبياً على أن منهج SFT مهيكل جيداً (استكشاف + تأمل) هو شرط مسبق لجعل الـ RL القائم على المكافأة المتفرقة فعالاً في مهام الاستدلال المعقدة، مما يحل مشكلة "البداية الباردة" للتعلم التعزيزي الوكيل.
التعميم: نجح إطار العمل في سد الفجوة بين بيانات التدريب وتوبولوجيا الاستدلال غير المرئية، مما يجعله اتجاهاً واعداً للوكلاء المستقلين في البيئات الهيكلية المعقدة.
الشيفرة البرمجية ومجموعات البيانات متاحة علناً، مما يسهل المزيد من الأبحاث في الاستدلال الوكيل عبر الرسوم البيانية المعرفية.