Who Speaks Matters: Authority-Aware Multi-View RAG over Italian Parliamentary Proceedings
تقدم هذه الورقة ParliamentRAG، وهو نظام توليد معزز بالاسترجاع مدرك للسلطة خاص بالمداولات البرلمانية الإيطالية، يقوم بوزن المتحدثين ديناميكيًا بناءً على الخبرة المتعلقة بالاستعلام للحد من تحيزات الهيمنة وأخطاء الاقتباس، متفوقًا بذلك على Google NotebookLM في التغطية السياسية ودقة الاقتباس مع الحفاظ على تفضيل الخبراء القوي.
المؤلفون الأصليون: Mirko Tritella, Riccardo Pozzi, Matteo Palmonari
المؤلفون الأصليون: Mirko Tritella, Riccardo Pozzi, Matteo Palmonari
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: نظام RAG متعدد الرؤى ومدرك للسلطة فوق المداولات البرلمانية الإيطالية
1. بيان المشكلة
تعد المداولات البرلمانية سجلاً أساسياً للتداول الديمقراطي، ومع ذلك فإن حجمها الهائل وتجزئتها يعيقان الوصول متعدد المنظورات للمواطنين والصحفيين والباحثين. إن الملاحة اليدوية مكلفة، كما أن بوابات البحث القياسية القائمة على الكلمات المفتاحية تعيد وثائق معزولة بدلاً من تقديم إجابات تركيبية متعددة الرؤى.
إن تطبيق نظام استرجاع معزز بالتوليد (RAG) قياسي على النصوص البرلمانية يفرض ثلاثة مخاطر محددة حددها المؤلفون:
- هيمنة المتحدثين الأكثر تكراراً: تميل النماذج اللغوية الكبيرة (LLMs) القياسية إلى المبالغة في تمثيل الفاعلين الأكثر صخباً، مما يعكس عدم التماثل التوزيعي في المتن بدلاً من الواقع السياسي الفعلي.
- الافتقار إلى السلطة الموضوعية: غالباً ما تقوم الأنظمة بتسطيح جميع المتحدثين بناءً على تشابه المحتوى، متجاهلة البيانات الوصفية التي تميز الخبير الموضوعي عن المعلق العابر.
- خطأ في نسب الاقتباس: في السياقات السياسية الحساسة، حتى المعدلات المنخفضة من الاقتباسات المهلوسة أو المسندة خطأً لا تتوافق مع الاستخدام الصحفي أو المؤسسي.
التحدي يكمن في بناء نظام يوفر ملخصات أمينة ومتعددة الرؤى للمواقف البرلمانية مع ضمان إمكانية التتبع للخطب الأصلية وتجنب التمثيل المفرط للتدخلات المنعزلة.
2. المنهجية: ParliamentRAG
يقدم المؤلفون ParliamentRAG، وهو نظام RAG مصمم لمجلس النواب الإيطالي. بُني النظام على رسم بياني للمعرفة (KG) موحد ويتبع مسار (استرجاع–ترتيب–توليد) يفرض تمثيلاً متعدد الرؤى، وإدراكاً للسلطة، وتتبعاً للاقتباس كقيود أساسية.
2.1 بنية الرسم البياني للمعرفة
يعمل النظام على رسم بياني للخصائص (property graph) مخزن في نسخة واحدة من Neo4j، حيث يدمج البيانات من البنية التحتية للبيانات المفتوحة لمجلس النواب الإيطالي (بتنسيق RDF).
- المخطط (Schema): ينمذج الرسم البياني هيكلاً هرمياً:
جلسة←مناظرة←مرحلة←خطاب←قطعة نصية (Chunk). - الكيانات: يتضمن 387 نائباً، 10 مجموعات برلمانية، 80 لجنة، 6,010 مناظرات، و40,416 خطاباً.
- الإثراء: تتضمن خصائص العقد بيانات بيوغرافية (التعليم، المهنة) مدمجة كمتجهات، وعلاقات مؤرخة زمنياً (مثل
عضو في مجموعةمع تواريخ البداية والنهاية) للتعامل مع التحولات الائتلافية. - وحدات الاسترجاع: تم تقسيم الخطابات إلى 151,073 قطعة نصية. تخزن كل قطعة النص، وتضميناً كثيفاً (dense embedding)، وإزاحات على مستوى الحروف (
start_char_rawوend_char_raw) لتمكين إعادة البناء الحرفي.
2.2 الاسترجاع ثنائي القناة
لضمان كل من الصلة الدلالية والخبرة المؤسسية، يستخدم النظام استراتيجية استرجاع ثنائية القناة:
- القناة الكثيفة (Dense Channel): تقوم بإجراء بحث عن التشابه المتجهي عبر القطع النصية للخطابات لالتقاط الصلة الموضوعية.
- قناة الرسم البياني (Graph Channel): تسترجع الأدلة بناءً على النشاط التشريعي. فهي تحدد الأعمال البرلمانية ذات الصلة بالاستعلام، وتنتقل إلى الموقعين عليها (الأصليين والموقعين الثانويين)، وتسترجع قطع الخطابات المرتبطة بهم. كما تمنح الأولوية للقطع القادمة من المتحدثين الأعضاء في اللجان ذات الصلة.
2.3 إعادة الترتيب المدركة للسلطة
يتم دمج الأدلة المسترجعة وإعادة ترتيبها باستخدام درجة مركبة:
score(e)=wrrr(e)+wddd(e)+wvvv(e)+waauthority(se,q)+wσσ(e)
حيث se هو المتحدث. تعطي الأوزان الأولوية للصلة ($0.35)والبروز(0.25)،بينماتضمنالتنوعوالتغطية(0.15و0.20$) التوازن بين المجموعات.
حساب درجة السلطة:
يتم حساب السلطة بعد الاسترجاع لتوجيه الترتيب دون تجاوز الصلة الموضوعية. وهي درجة تعتمد على الاستعلام وتجمع بين:
- التشابه الدلالي: تشابه جيب التمام (Cosine similarity) بين الاستعلام وسمات المتحدث (المهنة، التعليم، الأدوار في اللجان).
- إشارات النشاط: عدد الأعمال التشريعية الموقعة والتدخلات الخطابية مع مراعاة التلاشي الزمني.
- التلاشي الزمني: يتم وزن النشاط الأخير بشكل أعلى من البروز السابق.
- الانتماء الائتلافي: يتم حله في وقت الاستعلام لضمان النظر فقط في الأنشطة الحالية للمجموعات.
2.4 مسار التوليد متعدد الرؤى
تتبع عملية التوليد مساراً من أربع مراحل:
- التحليل: يتم تقسيم الاستعلام إلى ادعاءات ذرية مرتبطة بالأدلة لكل مجموعة برلمانية.
- التوليد: يتم إنتاج قسم لكل مجموعة من المجموعات العشر، مرتبة حسب درجة سلطة المتحدثين داخل تلك المجموعة. إذا لم يوجد دليل لمجموعة ما، يتم ذكر ذلك صراحة.
- التكامل: يتم دمج الأقسام في سرد متماسك.
- الاقتباس: من الناحية الجوهرية، لا يقوم النموذج اللغوي الكبير (LLM) بتوليد نص الاقتباس. بل يدرج نصوصاً مؤقتة (placeholders) مع إزاحات الحروف، والتي يتم استبدالها بشكل حتمي بأسطر فرعية حرفية من النصوص الأصلية. هذا يضمن دقة الاقتباس بنسبة 100% من خلال التصميم.
3. التقييم التجريبي
تم تقييم النظام مقابل Google NotebookLM (وهو نموذج تجاري قوي يستخدم Gemini 3) على مجموعة اختبار مكونة من 15 موضوعاً سياسياً.
3.1 البروتوكول
- مجموعة البيانات: 15 موضوعاً تغطي ثمانية مجالات كبرى (مثل العدل، الهجرة، الاقتصاد).
- إعداد النموذج المرجعي: تم تزويد NotebookLM بسياق منسق يبلغ حوالي 300 قطعة نصية لكل موضوع (الأدلة ذات الصلة + المشتتات) لمحاكاة الاسترجاع الخبير، حيث اعتُبر تغذية المتن الكامل غير ممكن.
- التقييم:
- المقاييس الآلية: التغطية (المجموعات التي تحتوي على اقتباس، الاكتمال)، دقة الاقتباس، ومتوسط السلطة.
- التقييم البشري: أجرى ستة خبراء في المجال (صحفيون، محللون) اختبار A/B أعمى على 67 تقييماً مزدوجاً عبر تسعة أبعاد لـ "ليكرت" (Likert).
3.2 النتائج
المقاييس الآلية:
- دقة الاقتباس: حقق ParliamentRAG درجة 1.00 (مثالية)، بينما حقق NotebookLM درجة 0.95.
- تغطية المجموعات: غطى ParliamentRAG 0.97 من المجموعات (مقابل 0.95 لـ NotebookLM).
- السلطة: استشهد ParliamentRAG بمتحدثين بمتوسط درجة سلطة أعلى قليلاً (0.53 مقابل 0.52).
التقييم البشري:
- الرضا العام: كان متقارباً بين النظامين (4.24 لـ ParliamentRAG مقابل 4.27 لـ NotebookLM).
- الطلاقة: فضل المستخدمون NotebookLM في الأبعاد المتعلقة بالنثر (جودة الإجابة، الوضوح)، ويرجع ذلك على الأرجح إلى توليده الأحادي ونموذجه الأساسي الأقوى.
- المصدر والتوازن: تفوق ParliamentRAG بشكل كبير على NotebookLM في الأبعاد المرتبطة مباشرة بتصميمه:
- تغطية المصدر: 4.64 مقابل 4.39 (تفضيل بنسبة 25% مقابل 5% لـ NotebookLM).
- سلطة المصدر: 4.21 مقابل 4.00.
- إدراك التوازن: 4.66 مقابل 4.48.
4. المساهمات الرئيسية والأهمية
يدعي البحث المساهمات والأهمية التالية:
- بنية مبتكرة: يعد هذا أول عمل يدمج الرسوم البيانية البرلمانية المهيكلة مع نمذجة السلطة المعتمدة على الاستعلام والتوليد متعدد الرؤى ضمن بنية RAG موحدة.
- ضمانات من خلال التصميم: يوفر النظام ضماناً هيكلياً لـ دقة الاقتباس الحرفي، مما يحل مشكلة حرجة لأنظمة المعلومات المدنية حيث يكون الهلوسة أمراً غير مقبول.
- نمذجة السلطة: يقدم طريقة لتقدير سلطة المتحدث ديناميكياً بناءً على الاستعلام، من خلال الجمع بين الإشارات البيوغرافية والمؤسسية والزمنية، بدلاً من الاعتماد فقط على تشابه المحتوى.
- التمثيل المتوازن: يضمن النظام أن تمثل الملخصات جميع المجموعات البرلمانية، مما يمنع هيمنة المتحدثين الأكثر تكراراً.
- التحقق التجريبي: يظهر التقييم أنه بينما قد تتفوق النماذج اللغوية الكبيرة العامة في الطلاقة، فإن القيود المفروضة معمارياً هي الأفضل لموثوقية المصدر، والتوازن، وإمكانية التتبع في السياقات السياسية.
يخلص المؤلفون إلى أنه بينما يمكن تخفيف قيود الطلاقة باستخدام نماذج لغوية أفضل، فإن الضمانات المتعلقة بالإسناد الحرفي والتغطية المنهقية للمجموعات تتطلب دعماً معمارياً خاصاً لا يمكن توفيره عبر التوجيه (prompting) وحده. النظام متاح للعمل مباشرة على parliamentrag.it مع توفر الكود المصدري تحت رخصة Apache-2.0.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.
تصلك أفضل أبحاث computer science كل أسبوع.
يحظى بثقة باحثين في ستانفورد وكامبريدج والأكاديمية الفرنسية للعلوم.
تفقّد بريدك لتأكيد الاشتراك.
حدث خطأ ما. تعيد المحاولة؟
لا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.