Verifiable by Construction: Claim-Level Evaluation of Verbatim Citation in Clinical Question Answering
تقيم هذه الورقة قدرة اثني عشر نموذجاً من نماذج اللغات الكبيرة على توليد إجابات سريرية قابلة للتحقق من خلال إرفاق اقتباسات حرفية بالادعاءات الواقعية، كاشفةً أنه في حين تستطيع معظم النماذج بنجاح إرفاق اقتباسات بأكثر من 90% من الادعاءات، إلا أن هذه الاقتباسات غالباً ما تفشل في إثبات تفاصيل الادعاءات التي ترافقها بشكل كامل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الطب الحديث عالي المخاطر، غالباً ما يكون الوقت هو المورد الأكثر ندرة. فعندما يواجه الطبيب حالة مريض معقدة، فإنه يحتاج إلى إجابات ليست دقيقة فحسب، بل موثوقة فوراً أيضاً. لسنوات طويلة، وعد الذكاء الاصطناعي بالمساعدة، مقدماً وعوداً بتلخيص كميات هائلة من الأدبيات الطبية في نصائح واضحة وسهلة القراءة. ومع ذلك، ظل هناك مشكلة مستمرة تلاحق هذه الأدوات: وهي الميل إلى اختلاق الحقائق، وهو عيب يُعرف باسم "الهلوسة". وفي مجال يمكن أن تؤدي فيه غلطة واحدة إلى إلحاق الضرر بالمريض، لا يمكن للطبيب ببساطة أن يثق في كلمة الكمبيوتر؛ بل يجب أن يكون قادراً على التحقق من مصدر كل عبارة. تقليدياً، عندما يقدم الذكاء الاصطناعي إجابة مع استشهاد، فإن هذا الاستشهاد غالباً ما يشير إلى وثيقة واسعة النطاق، مثل دليل طبي كامل أو ورقة بحثية. وهذا يجبر الممارس السريري المشغول على البحث عبر مئات الصفحات للعثور على الجملة المحددة التي تدعم الادعاء، وهي عملية تهدم الغرض من وجود مساعد فعال. لذا، فإن الهدف هو بناء أنظمة لا تكتفي فقط بالإشارة إلى المصدر، بل تثبت عملها من خلال عرض الكلمات الدقيقة من ذلك المصدر جنباً إلى جنب مع الإجابة.
لقد وضع فريق من الباحثين في جامعة جونز هوبكنز هدفاً لاختبار ما إذا كان بإمكان نماذج الذكاء الاصطناعي الحالية القيام بذلك بالفعل. فقد بنوا نظاماً متخصصاً مصمماً للإجابة على الأسئلة السريرية باستخدام أربعة أدلة طبية رئيسية تغطي أمراض القلب، وضغط الدم، والكوليسترول، والسكري. وبدلاً من ترك النماذج تقوم بمجرد تلخيص المعلومات، وجه الباحثون هذه النماذج لبناء إجاباتها جملة بجملة، مع إرفاق اقتباس مباشر، حرفي، من الدليل الأصلي بكل ادعاء واقعي تقدمه. ولرؤية ما إذا كان هذا سينجح، أنشأوا إطار عمل تجريبياً صارماً يعمل كمدقق رقمي. قام هذا النظام بتفكيك كل إجابة إلى مكوناتها من الادعاءات وفحصها مقابل ثلاثة معايير محددة: أولاً، هل أرفق النموذج استشهاداً بالادعاء؟ ثانياً، هل كان الاقتباس المرفق نسخة مطابقة تماماً للنص الأصلي، دون أي تغيير أو إعادة صياغة؟ وثالثاً، هل احتوى ذلك الاقتباس المحدد بالفعل على معلومات كافية لإثبات صحة الادعاء، دون حاجة القارئ للبحث في أي مكان آخر؟
اختبر الباحثون اثني عشر نموذجاً مختلفاً من النماذج اللغوية الكبيرة، تتراوح بين الأنظمة القوية والمعقدة إلى الأنظمة الأصغر والأسرع، باستخدام 222 سؤالاً سريرياً اصطناعياً مستمداً من الأدلة. وكشفت النتائج عن فجوة كبيرة بين ما تستطيع هذه النماذج فعله وما هو مطلوب لتحقيق الموثوقية الحقيقية. كانت معظم النماذج المتقدمة جيدة بشكل مفاجئ في الخطوتين الأوليين؛ فقد نجحت في إرفاق استشهادات بأكثر من 90 بالمائة من ادعاءاتها، وفي كثير من الحالات، كانت الاقتباسات التي قدمتها مطابقة تماماً للنص المصدر. ومع ذلك، تعثر النظام بشكل دراماتيكي عند الخطوة الأخيرة والأكثر أهمية: وهي إثبات الادعاء. فبينما قد يقدم النموذج اقتباساً مثالياً، إلا أن هذا الاقتباس غالباً ما يفشل في دعم الثقل الكامل للعبارة التي صاغها النموذج. على سبيل المثال، قد يقتبس النموذج جملة تقول إن عقاراً ما "مفضل" لمجموعة معينة، ثم يستخدم هذا الاقتباس لدعم ادعاء أوسع بأن هذا العقار "مطلوب" للجميع. وفي حالة بارزة، تمكن نموذج رفيع المستوى يُدعى "Claude Opus 5" من إرفاق اقتباس حرفي بـ 98 بالمائة من ادعاءاته، ومع ذلك، لم يتم إثبات 37.1 بالمائة فقط من تلك الادعاءات من خلال الاقتباسات وحدها. كانت الاقتباسات موجودة، وكانت دقيقة، لكنها كانت غير كافية لإثبات النقطة.
كما سلطت الدراسة الضوء على أن حجم ونوع النموذج يلعب دوراً كبيراً. فالنماذج الأصغر والأخف وزناً غالباً ما تفشل في إرفاق استشهادات بادعاءاتها على الإطلاق، أو تقدم اقتباسات ليست نسخاً مطابقة للمصدر، مما يؤدي إلى انهيار معدلات التحقق الخاصة بها. أحد أصغر النماذج التي تم اختبارها، وهو "Claude Haiku"، تمكن من دعم حوالي 25 بالمائة فقط من ادعاءاته بشكل كامل. وفي المقابل، أدت النماذج الأكبر أداءً بشكل أفضل بكثير، حيث دعمت أفضل الأنظمة حوالي 75 بالمائة من ادعاءاتها بأدلة دقيقة وكافية. ووجد الباحثون أن السبب الرئيسي للفشل لم يكن أن النماذج تكذب أو تخترع أشياء، بل لأنها كانت تكافح لاختيار الدليل الصحيح. فهي غالباً ما تلتقط اقتباساً ذا صلة بالموضوع ولكنه لا يحتوي على التفاصيل المحددة اللازمة لدعم الجملة بأكملة. ولاختبار ما إذا كان الدليل متاحاً بالفعل، طلب الباحثون من ذكاء اصطناعي منفصل البحث في الوثائق الأصلية عن اقتباسات كان من شأنها أن تدعم الادعاءات بشكل كامل. ووجدوا أنه بالنسبة للعديد من النماذج، كان الدليل المفقود موجوداً هناك في النص الذي قرأته بالفعل؛ إذ فشلت النماذج ببساء في استخراج وإرفاق القطع الصحيحة.
في نهاية المطاف، يوضح هذا العمل أنه بينما أصبح الذكاء الاصطناعي قادراً بشكل متزايد على استرجاع وتنسيق المعلومات الطبية، فإنه ليس جاهزاً بعد ليتم الوثوق به تماماً دون إشراف بشري في سياق سريري. إن القدرة على توليد إجابة سلسة تختلف عن القدرة على بناء إجابة قابلة للتحقق. تُظهر الدراسة أن النماذج الحالية يمكنها غالباً توفير المواد الخام للتحقق، لكنها تفشل تكراراً في تجميعها في برهان كامل ومكتفٍ بذاته. ويتطلب المسار المستقبلي أنظمة لا تكتفي فقط بالاستشهاد بالمصادر، بل تضمن أن كل كلمة من نصائحها مدعومة بدليل محدد وكافٍ وغير معدل من الأدلة الأصلية. وإلى أن تتمكن النماذج باستمرار من سد الفجوة بين امتلاك اقتباس وإثبات نقطة ما، ستظل مسؤولية التحقق في يد الممارس السريري البشري.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.