← أحدث الأبحاث
💬 NLP

TraceBack: Multi-Agent Decomposition for Fine-Grained Table Attribution

يقدم هذا البحث TraceBack، وهو إطار عمل متعدد الوكلاء يعزز الشفافية في الإجابة على الأسئلة القائمة على الجداول من خلال توفير عزو دقيق على مستوى الخلايا للإجابات، مصحوباً بمعيار CITEBench ومقياس FairScore الذي لا يعتمد على المراجع للتقييم المنهجي.

المؤلفون الأصليون: Tejas Anvekar, Junha Park, Rajat Jha, Devanshu Gupta, Poojah Ganesan, Puneeth Mathur, Vivek Gupta

نُشر 2026-02-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tejas Anvekar, Junha Park, Rajat Jha, Devanshu Gupta, Poojah Ganesan, Puneeth Mathur, Vivek Gupta

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تسأل أمين مكتبة ذكيًا جدًا، ولكنه مغرور أحيانًا، (ذكاء اصطناعي) سؤالاً حول مكتبة ضخمة من الجداول الحسابية. يعطيك أمين المكتبة إجابة مثالية. ولكن بعد ذلك تسأله: "كيف عرفت أن هذا صحيح؟ أي كتاب أو صفحة محددة قرأت منها؟"

غالبًا ما يكتفي أمين المكتبة بهز كتفيه أو الإشارة بشكل غامض إلى الرف بأكمله. هذه مشكلة. ففي المواقف عالية المخاطر (مثل النصائح الطبية أو التقارير المالية)، تحتاج إلى معرفة أي خلايا بالضبط في الجدول هي التي دعمت الإجابة.

تقدم هذه الورقة نظامًا جديدًا يسمى TRACEBACK لحل هذه المشكلة، جنباً إلى جنب مع طريقة جديدة لاختباره تسمى CITEBENCH و"بطاقة تقييم" جديدة تسمى FAIRSCORE.

إليك تفصيل الموضوع باستخدام تشبيهات بسيطة:

1. المشكلة: أمين المكتبة "الصندوق الأسود"

أنظمة الذكاء الاصطناك الحالية تشبه السحرة؛ يخرجون الإجابة الصحيحة من القبعة، لكن لا يمكنك رؤية الخدعة.

  • المشكلة: إذا قال الذكاء الاصطناعي: "الطاقة الشمسية هي الأكثر كفاءة"، فقد يكون محقًا، ولكنه قد يكون قد خمن الإجابة. نحن بحاجة إليه لكي يشير إلى الصف والعمود بدقة اللذين يقولان "الطاقة الشمسية: كفاءة 30-50%".
  • الطريقة القديمة: كانت الأدوات السابقة تشبه كاميرا ضبابية؛ كان بإمكانها إخبارك بأي صف توجد الإجابة، لكنها لم تكن تستطيع إخبارك بأي كلمة محددة في ذلك الصف كانت هي المفتاح. كما أنها كانت تغفل عن "الخطوات الوسطى" (مثل كيفية حساب الذكاء الاصطناعي للمدة الزمنية عبر النظر في وقت البداية ووقت النهاية).

2. الحل: TRACEBACK (فريق التحري)

بنى المؤلفون TRACEBACK، وهو ليس مجرد ذكاء اصطناعي واحد، بل فريق من وكلاء الذكاء الاصطناعي المتخصصين الذين يعملون معًا مثل فرقة تحرٍ. بدلاً من تخمين الإجابة في قفزة واحدة كبيرة، يقومون بتفكيك القضية:

  • الوكيل 1 (المُرشِّح): "حسنًا، نحن نبحث عن 'الطاقة الشمسية'. لنقم باستبعاد كل صف في الجدول لا يتعلق بالطاقة الشمسية." (تقليم الجدول).
  • الوكيل 2 (المُفكِّك): "السؤال معقد. لنقسمه إلى أدلة أصغر. أولًا، ابحث عن التكلفة. ثم، ابحث عن القابلية للتوسع. وأخيرًا، ابحث عن الكفاءة."
  • الوكيل 3 (صائد الأدلة): "الآن، بالنسبة لدليل 'التكلفة'، أشر إلى الخلية المحددة التي تقول '$30-50'."
  • الوكيل 4 (الرابط): "حسناً، لدينا خلية التكلفة، وخلية القابلية للتوسع، وخلية الكفاءة. لنقم بربطهم معًا لإثبات الإجابة النهائية."

النتيجة: نظام TRACEBACK لا يعطيك الإجابة فحسب؛ بل يعطيك الإيصال. فهو يوضح لك بالضبط أي الخلايا استُخدمت في كل خطوة من خطوات الاستنتاج، حتى الخطوات الخفية.

3. الاختبار الجديد: CITEBENCH (الامتحان المعياري الذهبي)

لمعرفة ما إذا كان TRACEBACK يعمل حقًا، احتاج المؤلفون إلى اختبار. لقد أدركوا أن الاختبارات الموجودة كانت معيبة:

  • العيب: الاختبارات القديمة كانت تشبه تقييم معلم لمقال طالب عبر التحقق فقط مما إذا كانت الجملة الأخيرة صحيحة، مع تجاهل العمليات الحسابية التي قام بها للوصول إليها. كما أن بعض الاختبارات القديمة كانت تحتوي على إجابات "مشوشة" (تعتبر الخلايا غير ذات الصلة مهمة).
  • الإصلاح: أنشأوا CITEBENCH. تخيل معلمًا يصحح 1,500 ورقة امتحان يدويًا. لكل إجابة، يرسم المعلم دائرة حمراء حول الخلايا الدقيقة في الجدول التي تثبت أن الإجابة صحيحة. هذا يخلق "معيارًا ذهبيًا" لقياس مدى جودة قدرة الذكاء الاصطناعي على إيجاد الحقيقة.

4. بطاقة التقييم: FAIRSCORE (المصحح الذي "لا يحتاج لمفتاح إجابة")

هذا هو الجزء الصعب: تصحيح 1,500 ورقة يدويًا أمر مكلف وبطيء. ماذا لو أردت اختبار الذكاء الاصطناعي على 100,000 سؤال؟ لا يمكنك توظيف بشر لهذا الغرض.

هنا يأتي دور FAIRSCORE.

  • التشبيه: تخيل أنه ليس لديك مفتاح الإجابة، ولكن لديك إجابة الطالب والكتاب المدرسي.
  • كيف يعمل: يأخذ FAIRSCORE إجابة الذكاء الاصطناعي ويقسمها إلى "حقائق ذرية" صغيرة (مثل: "الطاقة الشمسية تكلف 30 دولارًا"). ثم يأخذ الخلايا التي أشار إليها الذكاء الاصطناعي ويحولها أيضًا إلى حقائق ("الجدول يقول إن الطاقة الشمسية تكلف 30 دولارًا").
  • المطابقة: يقارن بين القائمتين.
    • إذا تطابقت حقائق الذكاء الاصطناعي مع الخلايا التي أشار إليها، فإنه يحصل على نقاط في الدقة (Precision) (أي أنه لم يكذب).
    • إذا كانت حقائق الذكاء الاصطنا_ي تغطي كل ما في الإجابة، فإنه يحصل على نقاط في الاستدعاء (Recall) (أي أنه لم يغفل شيئًا).
  • لماذا هو رائع: يمكنه تقييم عمل الذكاء الاصطناعي دون الحاجة إلى وجود بشر للتحقق من مفتاح الإجابة أولًا. إنه يشبه مساعد الواجب المنزلي الذي يصحح نفسه بنفسه.

5. النتائج

عندما أجروا الاختبارات:

  • سحق TRACEBACK المنافسة. كان أفضل بكثير في العثة على الخلايا الصحيحة بدقة مقارنة بالطرق السابقة.
  • أثبت FAIRSCORE أنه قاضٍ موثوق. حتى بدون مساعدة بشرية، حدد بدقة أي ذكاء اصطناعي كان يؤدي عملًا أفضل.

الملخص

فكر في هذه الورقة كبناء مطبخ شفاف.

  • الذكاء الاصطناعي القديم: يقدم لك حساءً لذيذًا لكنه لن يخبرك بما يحتويه.
  • TRACEBACK: يقدم لك الحساء ويسلمك إيصالًا مفصلاً يوضح بالضبط أي جزر وبطاطس وتوابل استُخدمت، وكيف تم تقطيعها.
  • CITEBENCH: طاهٍ ماهر يتحقق من الإيصال ليتأكد من دقته.
  • FAIRSCORE: روبوت ذكي يمكنه تذوق الحساء والتحقق من الإيصال ليرى ما إذا كانا متطابقين، حتى لو لم يكن الطاهي الماهر موجودًا في الغرفة.

هذا يجعل الذكاء الاصطناعي جديرًا بالثقة مرة أخرى، خاصة عندما تحتاج إلى معرفة لماذا أعطاك إجابة، وليس فقط ما هي الإجابة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →