A million-scale cross-document clinical citation-evidence question answering dataset
تقدم هذه الورقة البحثية RefQA، وهي مجموعة بيانات بمقياس المليون تضم 1.52 مليون سجل من أسئلة وأجوبة لـ "الاستشهاد بالأدلة عبر المستندات" مستمدة من PubMed Central، وتتميز ببيانات وصفية مهيكلة، وتأصيل ادعاءات قابل للتحقق، وتوصيفات عالية الجودة لدعم الأبحاث في تحليل الاستشهادات السريرية.
المؤلفون الأصليون:Imjin Ahn, Young-Hak Kim, Sanghyun Park, Tae Joon Jun
في المكتبة الشاسعة للعلوم الطبية، حيث تُنشر ملايين الأوراق البحثية كل عام، غالبًا ما تحمل جملة واحدة وزن قرار ينقذ حياة. فعندما يقرأ الطبيب توجيهًا جديدًا يوصي بعلاج محدد، فإن تلك التوصية تستند عادةً إلى سلسلة من المراجع التي تشير إلى دراسات سابقة. هذه المراجع هي الحلقات في السلسلة، التي تربط ادعاءً حاليًا بالدليل الأصلي. ومع ذلك، منذ عقود، يعلم المجتمع العلمي أن هذه الحلقات ليست قوية دائمًا؛ فأحيانًا تدعي ورقة بحثية أنها تدعم فكرة ما، لكن الدراسة الأصلية التي تستشهد بها تقول في الواقع شيئًا مختلفًا، أو ربما لا تقول شيئًا عن ذلك الموضوع على الإطلاق. هذه الفجوة بين ما تقوله الورقة عما وجدته وبين ما يحتويه المصدر بالفعل تخلق حالة من عدم اليقين الخطير للأطباء الذين يحاولون استيعاب الأدبيات الطبية. ولإصلاح ذلك، احتاج الباحثون إلى وسيلة لا تقرأ الأوراق فحسب، بل تقرأ أيضًا الروابط بينها، وتتحقق من أن كل ادعاء مدعوم حقًا بالدليل الذي يستشهد به.
قام فريق من الباحثين الآن ببناء أداة رقمية ضخمة لحل هذه المشكلة، حيث أنشأوا مجموعة بيانات تحتوي على أكثر من 1.5 مليون سجل لهذه الروابط. ويطلقون عليها اسم RefQA. يركز المشروع على الأدبيات السريرية، وتحديدًا الأوراق التي تتعامل مع صحة الإنسان ورعاية المرضى. بدأ الفريق بجمع ملايين المقالات كاملة النص من أرشيف عام معروف باسم PubMed Central. لم يكتفوا بالنظر في النص فحسب، بل نظروا في اللحظات المحددة التي تذكر فيها ورقة بحثية ورقة أخرى. في الملفات الرقمية لهذه المقالات، وفي كل مرة يشير فيها الكاتب إلى دراسة سابقة، يوجد علامة مخفية تربط بين المستندين. استخدم الباحثون برامج حاسوبية للعثور على كل رابط من هذه الروابط، مما خلق خريطة لمن يستشهد بمن عبر المجال بأكمله للطب السريري.
كان التحدي يكمن في فهم المعنى الكامن وراء كل رابط. فالاستشهاد ليس مجرد مؤشر، بل هو إقرار بالاعتقاد؛ فعندما يقول الكاتب: "كما هو موضح في الدراسة (س)"، فإنه يدلي بادعاء حول ما أثبتته الدراسة (س). أراد الباحثون معرفة ما إذا كان هذا الادعاء صحيحًا. ولمعرفة ذلك، استخدموا نظام ذكاء اصطناعي قوي لقراءة الجملة المستشهد بها وملخص الورقة المستشهد بها جنبًا إلى جنب. تم تدريب الذكاء الاصطناعي ليعمل كمحرر دقيق، يطرح أسئلة محددة: ماذا يحاول الكاتب أن يقول؟ هل تدعم الورقة الأصلية هذه الفكرة حقًا؟ هل الدليل قوي، أم ضعيف، أم مفقود؟ تم توجيه النظام ليكون دقيقًا للغاية؛ فإذا قرر الذكاء الاصطناعي أن الورقة الأصلية تدعم الادعاء، كان عليه استخراج اقتباس مباشر، كلمة بكلمة، من الملخص الأصلي لإثبات ذلك. هذا المتطلب يعني أن حقيقة الادعاء يمكن التحقق منها فورًا من قبل أي شخص يقرأ السجل.
طبق الفريق مرشحًا صارمًا لضمان صلة البيانات بالطب البشري؛ حيث احتفظوا فقط بالاستشهادات التي كانت فيها كل من الورقة الكاتبة والورقة المستشهد بها تتناولان أبحاثًا سريرية تشمل مرضى. أزالت هذه القاعدة ملايين السجلات التي تخلط بين تجارب العلوم الأساسية والدراسات البشرية، مما ضمن أن مجموعة البيانات النهائية تحتوي فقط على سلاسل الأدلة التي يمكن للأطباء استخدامها فعليًا. وبعد تشغيل هذه العملية على أكثر من 1.5 مليون حدث استشهاد، كانت النتيجة مجموعة منظمة ونظيفة من السجلات. يحتوي كل سجل على سياق الاستشهاد، وتفاصيل الورقتين المعنيتين، وتحليل الذكاء الاصطناعي للعلاقة بينهما. كان النظام دقيقًا بشكل ملحوظ، حيث اتبع كل سجل التنسيق المطلوب بدقة في معظم الحالات. وعندما فحص خبراء بشريون عينة صغيرة من العمل، اتفقوا مع أحكام الذكاء الاصطناعي بشأن ما إذا كان الاستشهاد ذا صلة أو مضللاً في معظم الحالات، مما أكد أن الآلة قد تعلمت التمييز بين الرابط المتين والرابط المكسور.
تعد القدرة على كشف الأخطاء واحدة من أهم ميزات مجموعة البيانات هذه. فقد وجد الباحثون أن عددًا كبيرًا من الاستشهادات في الأدبيات الطبية لا تدعم في الواقع الادعاءات المقدمة عنها. ففي بعض الحالات، قد تستشهد ورقة بدراسة لدعم إحصائية ما، بينما لم تذكر تلك الدراسة ذلك الرقم أبدًا. وفي حالات أخرى، قد تدعي ورقة ما أن علاجًا ما فعال، بينما وجدت الدراسة المستشهد بها في الواقع عدم وجود فرق بين العلاج والعقار الوهمي (placebo). تلتقط مجموعة البيانات هذه التناقضات، وتصنفها بوضوح حتى تتمكن البرامج الحاسوبية المستقبلية من التعرف عليها. كما قدم الباحثون نسخة من البيانات متاحة للاستخدام المجاني في المشاريع التجارية، مع إبقاء المجموعة الكاملة متاحة لأولئك الذين يحتاجون إلى رؤية الصورة الكاملة، بما في ذلك الأوراق ذات قواعد الاستخدام الأكثر تقييدًا.
إن حجم هذا العمل غير مسبوق. فالمحاولات السابقة لرسم هذه الروابط كانت إما صغيرة جدًا بحيث لا يمكن الاستفادة منها في تدريب الأنظمة الحاسوبية المتقدمة، أو واسعة جدًا بحيث لا يمكنها التقاط المعنى المحدد للاستشهادات. تسد مجموعة البيانات الجديدة هذه الفجوة، حيث تقدم موردًا بمقياس المليون يتسم بالعمق والاتساع في آن واحد. فهي تسمح للباحثين بتدريب نماذج ذكاء اصطناعي جديدة لقراءة الأدبيات الطبية بمستوى من التدقيق لم يكن ممكنًا من قبل. ومن خلال تعليم هذه النماذج التحقق من الادعاءات مقابل مصادرها، يساعد هذا العمل في بناء مستقبل تُبنى فيه القرارات الطبية على أدلة تم فحصها بدقة. مجموعة البيانات متاحة الآن للعلماء والمطورين لاستخدامها، مما يوفر أساسًا لأدوات يمكنها مساعدة الأطباء في التنقل عبر الحجم الهائل للأبحاث الطبية بثقة ودقة أكبر.
ملخص تقني: RefQA – مجموعة بيانات لأسئلة وأجوبة الاستشهاد بالأدلة السريرية عبر المستندات بمقياس المليون
بيان المشكلة
في الأدبيات السريرية، غالبًا ما تحمل الاستشهادات ثقلاً دلاليًا يتجاوز مجرد كونها إشارات بسيطة؛ فهي تؤكد أن الورقة المُستشهد بها تدعم ادعاءات محددة. ومع ذلك، تشير الدراسات التدقيقية إلى أن جزءًا غير ضئل من الاستشهادات الطبية يسيء تمثيل مصادرها. تفشل الموارد الحالية في معالجة هذه الفجوة على نطاق واسع: فمجموعة LongCite تربط الاستشهادات بالإجابات داخل المستندات المنفردة ولكنها لا تتبع الاستشهادات إلى مصادرها؛ ومجموعة OpCitance تتوسع لتشمل ملايين الاستشهادات عبر المستندات ولكنها تفتقر إلى طبقة الأسئلة والأجوبة الدلالية؛ أما الموارد التي تم التحقق منها يدويًا مثل CliniFact و MedAESQA فهي صغيرة جدًا لتدريب واسع النطاق. هناك حاجة لمجموعة بيانات قابلة للقراءة آليًا وضخمة تربط الاستشهادات داخل النص بأدلة محددة في الأوراق المستشهد بها، معبرًا عنها في شكل أزواج أسئلة وأجوبة يمكن التحقق منها، لتمكين تدقيق سلاسل الإسناد وتدريب أنظمة التوليد المعزز بالاسترجاع (RAG) الموثوقة.
المنهجية
تم بناء RefQA من خلال مسار عمل حتمي متعدد المراحل يعالج مقالات PubMed Central (PMC) مفتوحة الوصول. يتكون المسار من ثلاث مراحل أساسية:
1. الاستحواذ والاستخراج الهيكلي
المصدر: 217 أرشيف XML بتنسيق JATS من PMC (لقطات 2026)، بإجمالي 145 جيجابايت.
التحليل: يقوم محلل مخصص باستخراج بيانات وصفية للمقالات، وأقسام المتن (الموزعة على حاويات IMRaD)، وأحداث الاستشهاد داخل النص (<xref ref-type="bbr">).
التقاط السياق: لكل استشهاد، يسجل النظام الفقرة المحيطة، والجملة المستشهد بها، وعنوان القسم، وعدد الاستشهادات المشتركة، ومعرف الورقة المستشهد بها تحديدًا.
إثراء البيانات الوصفية: يربط فهرس Parquet نحيف بيانات PMC مع بيانات PubMed ومقاييس iCite (بما في ذلك أعلام is_clinical ونسبة الاستشهاد النسبية والنسبة المئوية لـ NIH).
2. الإثراء السريري-السريري
يتم تطبيق مرشح "الازدواج السريري" الصارم: لا يتم الاحتفاظ بالسجل إلا إذا تم تصنيف كل من الورقتين (المستشهد بها والمستشهد بها) كـ is_clinical = True في iCite. بالإضافة إلى ذلك، يجب أن تمتلك الورقة المستشهد بها ملخصًا غير فارغ في PubMed ليعمل كأرضية للتحقق من الموثوقية. يستبعد هذا المرشح السلاسل الانتقالية (السريرية التي تستشهد بالعلوم الأساسية) لضمان بقاء سلسلة الأدلة ضمن المجال السريري، مما نتج عنه 1,582,658 سجلًا للاستخراج الدلالي.
3. الاستخراج الدلالي باستخدام GLM-5.1-FP8
تتم معالجة السجلات المثرية بواسطة نموذج GLM-5.1-FP8 تحت "مطالبة نظام" (system prompt) ثابتة لإنشاء هيكل CitationQA بصيغة JSON صارمة. يفرض المخطط ما يلي:
التمييز المزدوج: الفصل بين ماذا يدعي الاستشهاد (الغرض) وبين كيف يتم تقديمه (نوع الدليل).
التأسيس اللفظي: إذا كانت الورقة المستشهد بها تدعم الادعاء، يجب على النموذج استخراج نص فرعي حرفي من ملخص الورقة المستشهد بها.
آلية الامتناع: إذا كان الاستشهاد غير متطابق، يجب على النموذج تصفير حقول الادعاء/الإجابة وتقديم mismatch_reason (سبب عدم التطابق).
الاستخراج الإحصائي: تؤدي الادعاءات الرقمية إلى إنشاء كائن statistic_extraction مهيكل.
يعمل المسار على أسطول مكون من خمس عقد من وحدات معالجة الرسوميات NVIDIA B200، حيث أتم عملية الاستخراج في حوالي 72 ساعة.
المساهمات الرئيسية
النطاق والحجم: تحتوي RefQA على 1,524,426 سجل استشهاد-دليل عبر المستندات، تشير إلى 347,247 ورقة مستشهد بها فريدة عبر التخصصات السريرية الكبرى (أمراض القلب والأوعية الدموية، الأورام، الأمراض المعدية). هذا هو أول معيار ضخم من نوعه للأدبيات السريرية.
الموثوقية القابلة للتحقق: تتضمن مجموعة البيانات اقتباسًا لفظيًا من الملخص المستشهد به للادعاءات المدعومة، مما يسمح للمستخدمين النهائيين بالتحقق من الموثوقية عبر مطابقة النصوص الفرعية.
المخطط الصارم والترخيص:
تتبع المخرجات مخطط JSON صارم مكون من 12 حقلًا مع قيود شرطية.
تعالج المجموعة تباين التراخيص من خلال توفير مجموعة فرعية مسموح بها (561,795 سجلًا، CC-BY/الملكية العامة) ومجموعة كاملة (1,524,426 سجلًا) مع أعمدة تراخيص لكل سجل.
قابلية التكرار: المسار حتمي، ويعتمد على استخراج هيكلي قائم على القواعد ولقطات مثبتة لعام 2026. يتم إصدار الكود والمطالبات والبذور (seeds) بموجب رخصة MIT.
النتائج والتحقق التقني
صحة المخطط: حققت دورة الإنتاج معدل تحقق من المخطط بنسبة 99.99994% (1,582,557/1,582,558 سجلًا اجتازت الاختبار). تم استبعاد فشل واحد متبقٍ من المستودع الأساسي.
الموثوقية:
مطابقة النص الفرعي المرنة: 96.03% من السجلات التي تتطلب اقتباسًا تحتوي على نص فرعي يطابق الملخص المستشهد به (مع مراعاة تطبيع المسافات والشرطات).
مطابقة النص الفرعي الدقيقة: 89.12% متطابقة تمامًا من حيث البايتات.
تأثير الاقتطاع: لم يفشل أي سجل في الموثوقية بسبب اقتطاع المطالبة عند 3,500 حرف، مما يؤكد أن الخيار الهندسي لم يمس جودة البيانات.
التعليق البشري: تم تعليق 250 سجلًا متداخلًا طبقياً من قبل مراجعين بشريين (مرشح دكتوراه وطبيب معتمد من البورد).
اتفاق الصلة: معامل كوهين κ = 0.68 (جوهري).
موثوقية الادعاء: معامل الارتباط داخل الفئة (ICC) = 0.72 (جيد).
موثوقية الإجابة: معامل الارتباط داخل الفئة (ICC) = 0.25 (منخفض، مما يعكس ذاتية تسجيل الإجابات متعددة الجمل).
الاتفاق بين النماذج: عند إعادة التعليق بواسطة GPT-5.4-mini و Claude Sonnet 4.6:
تصميم الدراسة: اتفاق شبه مثالي (κ 0.80–0.87).
الحقول الذاتية: اتفاق ضعيف إلى متوسط (κ 0.21–0.51) للملاءمة وقوة الدعم، مما يشير إلى أنها حقول متأثرة بالنماذج.
الدراسة الاستبعادية (Ablation): قللت الخيارات التصميمية (حاوية المتبقي الملاحظاتي وتوضيح WHAT/WHY) من معدلات فشل المخطط بمقدار 234 ضعفًا مقارنة بالمطالبة التجريبية.
الأهمية والادعاءات
يضع المؤلفون RefQA كمورد أساسي لـ:
التدريب والتقييم: تمكين الإجابة على الأسئلة السريرية المستندة إلى الاستشهاد حيث يعمل الاقتباس اللفظي كهدف موثوقية مدمج.
كشف الهلوسة: توفير فئة سلبية طبيعية (سجلات عدم التطابق) ومجموعة فرعية تم التحقق منها بشريًا من الحالات العدائية (10 سجلات) لتقييم أنظمة التوليد المعزز بالاسترجاع.
تدقيق الادعاء-الدليل: السماح بالتحقق مما إذا كان ادعاء الورقة المستشهد بها مدعومًا بالفعل من المصدر المستشهد به.
الضبط الدقيق الخاضع للإشراف: دعم تدريب النماذج اللغوية الطبية على أزواج الاستشهاد-الأدلة المهيكلة.
يدعي البحث بتواضع أنه بينما تمكن مجموعة البيانات هذه التطبيقات، فإن الحقول الذاتية (الملاءمة، قوة الدعم) يجب معاملتها كحقول متأثرة بالنماذج وليس كحقائق مطلقة، وعلى المستخدمين الذين يتطلب عملهم دقة عالية في هذه المجالات الاعتماد على المجموعة الذهبية التي تم التحقق منها بشريًا أو إعادة الاستخراج باستخدام نماذج بديلة. لا تدعي مجموعة البيانات تغطية السلاسل الانتقالية أو المراجعات المنهجية (المستبعدة بواسطة مرشح is_clinical)، بل تركز بدلاً من ذلك على متن دفاعي من الأدلة السريرية المباشرة (من سريري إلى سريري).