← أحدث الأبحاث
💬 NLP

FT-RAG: A Fine-grained Retrieval-Augmented Generation Framework for Complex Table Reasoning

تقدم هذه الورقة البحثية FT-RAG، وهو إطار عمل للتوليد المعزز بالاسترجاع دقيق التفاصيل يقوم بتفكيك الجداول إلى وحدات دلالية على مستوى المدخلات ويستخدم توسيع الجوار الهيكلي ليتفوق بشكل كبير على النماذج المرجعية الحالية في الاستدلال على الجداول المعقدة، مدعوماً بمعيار Multi-Table-RAG-Lib المقترح حديثاً.

المؤلفون الأصليون: Zebin Guo, Weidong Geng, Ruichen Mao

نُشر 2026-05-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zebin Guo, Weidong Geng, Ruichen Mao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق يحاول حل قضية معقدة. أدلتك ليست مجرد كومة من الملاحظات المتناثرة؛ بل هي خزانة ملفات ضخمة تحتوي على آلاف الجداول البيانية (البيانات الجدولية) المختلطة مع تقارير طويلة (نصوص).

المحققون الحاليون من الذكاء الاصطناوي (النماذج اللغوية الكبيرة) بارعون في قراءة التقارير الطويلة، لكنهم عندما يصطدمون بالجداول، يميلون إلى الارتباك. غالبًا ما يعاملون الجدول بأكمله كأنه فقرة واحدة فوضوية، أو يحاولون تسطيحه ليصبح مجرد قائمة. هذا يتسبب في جعلهم يفقدون التفاصيل الدقيقة والحاسمة المخفية في خلايا معينة، مثل رقم محدد في صف وعمود معينين. قد يجدون "الموضوع" الصحيح، لكنهم يلتقطون "الرقم" الخطأ.

تقدم هذه الورقة البحثية نظام FT-RAG (الاسترجاع المعزز بالتوليد المدرك للجداول بدقة متناهية)، وهو نظام جديد مصمم لإصلاح ذلك. إليك كيف يعمل، مقسمًا إلى مفاهções بسيطة:

1. المشكلة: "البيتزا الكاملة" مقابل "الشريحة"

فكر في ذكاء اصطناعي تقليدي يحاول قراءة جدول كما لو كان شخصًا يحاول أكل بيتزا كاملة في قضمة واحدة. إنه يبتلع البيتزا بأكملها (الجدول بالكامل) دون تذوق الإضافات المحددة (نقاط البيانات المحددة). إذا سألته: "ما هو الربح في شهر مارس؟" وقام الذكاء الاصطناعي بجلب صفحة "التقرير المالي" بأكملها، فسيتعين عليه التخمين أي رقم هو الربح وأي رقم هو التكلفة. الأمر فوضوي وعرضة للأخطاء.

2. الحل: نهج "الليغو" الخاص بـ FT-RAG

يغير FT-RAG قواعد اللعبة عن طريق تفكيك الجدول إلى أصغر أجزائه الأكثر معنى قبل أن ينظر إليه الذكاء الاصطناعي حتى.

  • الخطوة 1: المسح الدقيق (التفكيك على مستوى المدخلات)
    بدلاً من رؤية الجدول ككتلة واحدة كبيرة، يقوم FT-RAG بتفكيكه إلى "مجموعات خلايا" فردية. تخيل أخذ كل مربع في جدول بيانات ولفه داخل فقاعة واقية. داخل تلك الفقاعة، لا يرى الذكاء الاصطناعي الرقم "500" فحسب؛ بل يرى "500"، بالإضافة إلى رأس العمود "الإيرادات"، ورأس الصف "الربع الأول"، وعنوان المستند "التقرير السنوي لعام 2024". إنه يعرف بالضبط أين يعيش هذا الرقم.

  • الخطوة 2: بناء خريطة "SAT" (الرسم البياني المهيكل)
    بمجرد تفكيك البيانات إلى هذه الفقاعات الصغيرة، يبني FT-RAG خريطة منظمة ضخمة تسمى رسم SAT البياني.

    • S (الموضوع - Subject): عن مَن أو عماذا يتحدث هذا؟ (مثلاً: "الشركة أ")
    • A (السمة - Attribute): ماذا نقيس؟ (مثلاً: "الإيرادات")
    • T (الزمن - Temporal): متى حدث هذا؟ (مثلاً: "2024")

فكر في هذه الخريطة مثل نظام مترو الأنفاق. بدلاً من التجول بلا هدف في مدينة (المستند بأكمله)، يركب الذكاء الاصطناوي قطارًا يذهب مباشرة من "الشركة أ" إلى "الإيرادات" ثم إلى "2024". إنه يربط النقاط منطقيًا، مما يضمن أن الرقم الذي يجده مرتبط بالفعل بالوقت الصحيح وبالشركة الصحيحة.

  • الخطوة 3: فحص "الجار" (توسيع الجوار الهيكلي)
    أحيانًا، لا تكون الإجابة مجرد رقم واحد؛ بل هي اتجاه أو نمط. إذا سألت: "كيف نمت الإيرادات؟"، يحتاج الذكاء الاصطناعي لرؤية رقم عام 2023 وعام 2024 معًا. يمتلك FT-RAG ميزة خاصة تقوم تلقائيًا بفحص "الجيران" على الخريطة. إذا وجد بيانات عام 2024، فإنه يسحب فورًا بيانات عام 2023 المجاورة لها، تمامًا مثل محقق يتحقق من حجة غياب جار لمشتبه به للحصول على الصورة الكاملة.

  • الخطوة 4: خلط المكونات (الدمج متعدد الوسائط)
    غالبًا ما تكون الجداول جافة وتفتقر إلى السياق. قد يعني الرقم "ربحًا" في تقرير ما و"خسارة" في تقرير آخر اعتمادًا على النص المحيط. يأخذ FT-RAG الرقم الدقيق الذي وجده على الخريطة ويجلب الجمل القريبة من التقرير ليشرح لماذا هذا الرقم مهم. إنه يدمج البيانات الصلبة (الجدول) مع القصة (النص) ليفهم الذكاء الاصطناوي السياق الكامل.

3. ساحة التدريب الجديدة: Multi-Table-RAG-Lib

أدرك المؤلفون أنه لكي يختبروا هذا المحقق الجديد، كانوا بحاجة إلى اختبار أصعب مما هو موجود سابقًا. معظم الاختبارات كانت تسأل فقط أسئلة بسيطة حول جدول واحد (مثل "ما هو سعر المنتج X؟").

لقد بنوا مكتبة جديدة ضخمة تسمى Multi-Table-RAG-Lib.

  • التحدي: تحتوي هذه المكتبة على ما يقرب من 10,000 سؤال تتطلب من الذكاء الاصطناوي القفز بين جداول متعددة مختلفة ودمج تلك البيانات مع النصوص.
  • الهدف: إنها تجبر الذكاء الاصطناوي على أن يكون خبيرًا في التكامل، وليس مجرد محرك بحث بسيط.

4. النتائج: انتصار واضح

عندما وضعوا FT-RAG تحت الاختبار مقابل أفضل أنظمة الذكاء الاصطناعي الأخرى:

  • الدقة: وجد نقاط البيانات المحددة (الخلايا) بشكل أكثر تكرارًا من أي شخص آخر. لقد حسن القدرة على إيجاد الخلية الصحيحة تمامًا بنسبة تقارب 60%.
  • الموثوقية: عندما قام الذكاء الاصطناعي بتوليد إجابة، كان أكثر عرضة للحصول على الأرقام الفعلية الصحيحة (تحسن بنسبة 62% في دقة القيم الفعلية).
  • الاتساق: لم يكن الأمر مجرد ضربة حظ؛ فقد تفوق باستمرار على المنافسين عبر جميع أنواع الأسئلة الصعبة والمتعددة الجداول.

الملخص

باختصار، FT-RAG يشبه ترقية محقق من شخص يقرأ ملفًا كاملاً آملًا في العثور على دليل، إلى خبير جنائي لديه خريطة عالية التقنية لكل قطعة من الأدلة، ويعرف تمامًا كيف ترتبط ببعضها البعض، ويمكنه سحب القصة المحيطة فورًا لجعل الأرقام ذات معنى. إنه يمنع الذكاء الاصطناوي من الهلوسة أو التخمين ويجبره على تأصيل إجاباته في الواقع الهيكلي الدقيق للبيانات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →