← أحدث الأبحاث
📄 health informatics

Citation reliability of frontier large language models in medical writing and its automated verification

تكشف هذه الدراسة أنه في حين تُنتج النماذج اللغوية الكبيرة الرائدة نسبة كبيرة من الاستشهادات الطبية غير الموثوقة — عبر سوء الإسناد أساساً وليس التزييف — فإن نظام "سلسلة التحقق" الآلي يمكنه اكتشاف هذه الأخطاء بدقة تضاهي دقة الخبراء، مما يقدم حلاً قابلاً للتطبيق لضمان سلامة الاستشهاد في الكتابة الطبية المدعومة بالذكاء الاصطناعي.

المؤلفون الأصليون: Shin, R., Lee, J.-M., Park, J., Kwun, J.-S., Cho, H.-W., Kang, S.-H., Jeon, K.-H.

نُشر 2026-09-04
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Shin, R., Lee, J.-M., Park, J., Kwun, J.-S., Cho, H.-W., Kang, S.-H., Jeon, K.-H.

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل

في الممارسة الطبية الحديثة، تُعد كتابة ورقة بحثية أو مقال مراجعة عملية صارمة تتطلب دقة مطلقة. يجب على المؤلفين ليس فقط تلخيص المعرفة الطبية المعقدة، بل وأيضاً إسناد كل ادعاء إلى مصدر دليل محدد وقائم بالفعل. هذه المصادر هي الاستشهادات المرجعية، التي تعمل كآثار أقدام للاكتشاف العلمي، حيث توجه القراء للعودة إلى الدراسات الأصلية التي تدعم فكرة جديدة. لعقود من الزمن، كانت هذه العملية جهداً بشرياً، يتطلب فحصاً دقيقاً للأسماء والتواريخ وعناوين المجلات لضمان أن المرجع موجود بالفعل ويقول ما يزعم المؤلف أنه يقوله. ومع ذلك، دخلت أداة جديدة إلى المختبر والمكتبة: النموذج اللغوي الكبير. هذه برامج حاسوبية قوية مدربة على كميات هائلة من النصوص يمكنها صياغة المقالات، وتلخيص النتائج، وتوليد قوائم المراجع في ثوانٍ. وبينما تقدم وعداً بالسرعة والكفاءة، برز سؤال حاسم: هل يمكن الوثوق بهذه الآلات للعثور على آثار الأقدام الصحيحة، أم أنها أحياناً تخترعها؟

هذا السؤال ليس مجرد مسألة أكاديمية؛ بل إنه يضرب في قلب النزاهة الطبية. فإذا كتب حاسوب مراجعة طبية وتضمن استشهاداً يبدو حقيقياً ولكنه يشير إلى الدراسة الخطأ، أو والأسوأ من ذلك، إلى دراسة لم توجد أبداً، فإن الحجة بأكملها قد تنهار. هذه الظاهرة، المعروفة باسم "الهلوسة"، كانت نقطة ضعف معروفة في نماذج الحاسوب السابقة. ولكن مع تطور هذه الأدوات، لتصبح أسرع ومجهزة بالقدرة على البحث في الإنترنت في الوقت الفعلي، أصبح من غير الواضح ما إذا كانت قد تعلمت أخيراً كيفية الاستشهاد بشكل صحيح. يحتاج المجتمع الطبي إلى معرفة ما إذا كانت هذه النماذج المتقدمة الجديدة موثوقة بما يكفي لاستخدامها في الأبحاث الجادة، وإذا لم تكن كذلك، فهل هناك طريقة عملية لكشف أخطائها قبل نشرها.

وضع فريق من الباحثين هدفهم للإجابة على هذه الأسئلة من خلال وضع ثلاثة من أكثر نماذج الحاسوب تقدماً تحت اختبار صارم. طلبوا من كل نموذج كتابة سلسلة من المراجعات الطبية القصيرة حول تسعة مواضيع مختلفة في مجال طب القلب، وهو علم دراسة القلب والأوعية الدموية. تراوحت المواضيع من الحالات الشائعة إلى الإجراءات النادرة، مما ضمن مزيجاً من الموضوعات ذات الدراسات المنشورة الكثيرة والموضوعات ذات الدراسات القليلة جداً. تم توجيه كل نموذج لكتابة مراجعة تتراوح بين 600 إلى 900 كلمة وتضم بالضبط ثلاثين مرجعاً لكل مقال، بإجمالي 270 مراجعة وأكثر من 8,000 استشهاد. والأهم من ذلك، سمح الباحثون للنماذج باستخدام أدوات البحث عبر الويب المدمجة بها، محاكيين بذلك كيفية استخدام المستخدم لها في بيئة واقعية. كان الهدف هو معرفة عدد هذه الآلاف من الاستشهادات التي كانت صحيحة بالفعل.

كشفت النتائج عن مشهد من التباين الكبير والخطأ المستمر. عندما فحص الباحثون كل استشهاد بمفرده مقابل قاعدة البيانات الطبية الرسمية، وجدوا أن النماذج لم تكن مثالية. أدى نموذج واحد، وهو GPT-5.5، أفضل أداء، حيث أنتج استشهادات إشكالية في حوالي 11.5 بالمائة من الحالات. ومع ذلك، ارتكب النموذجان الآخران، Claude Opus 4.8 وGemini 3.5 Flash، أخطاء في ما يقرب من 30 بالمائة من استشهاداتهما. وهذا يعني أنه مقابل كل عشر مراجع يتم توليدها بواسطة النماذج الأقل دقة، يكون هناك حوالي ثلاثة مراجع معيبة. كما استقصى الباحثون ما إذا كانت النماذج تعاني أكثر مع المواضيع التي تحتوي على دراسات منشورة أقل، خوفاً من أن يؤدي نقص المعلومات المتاحة إلى إرباك الحاسوب. ووجدوا أنه بينما كانت معدلات الخطأ أقل قليلاً للمواضيع ذات الأدبيات الأكثر وفرة، إلا أن الفرق لم يكن قوياً بما يكفي لاعتباره قاعدة قطعية. لقد ارتكبت النماذج أخطاءً في جميع المجالات، بغض النظر عن مقدار المعلومات المتاحة حول الموضوع.

ربما كان الاكتشاف الأكثر كشفاً هو طبيعة الأخطاء نفسها. توقع الباحثون العثور على حالات كثيرة حيث يخترع الحاسوب ببساطة مقالاً وهمياً، وهو شكل كلاسيكي من أشكال الهلوسة. بدلاً من ذلك، وجدوا أن الغالبية العظمى من الأخطاء كانت أكثر دقة وتخفياً. حوالي 77 بالمائة من الاستشهادات الإشكالية كانت حالات "خطأ في الإسناد". في هذه الحالات، قدم الحاسوب معرفاً حقيقياً وصالحاً لمقال طبي حقيقي، لكن هذا المقال لم يكن هو المقال الذي ادعى النموذج أنه كذلك. كان الأمر كما لو أن الحاسوب وجد كتاباً حقيقياً في مكتبة ولكنه وضعه على الرف الخطأ، ووضع عليه عنوان كتاب آخر. هذا النوع من الخطأ خطير للغاية لأنه يبدو صحيحاً للوهلة الأولى؛ فقد يرى القارئ البشري رقماً صالحاً ويفترض أن المرجع جدير بالثقة، ليكتشف لاحقاً أن المصدر لا يدعم النقطة التي يتم طرحها. أما التزييف الحقيقي، حيث يخترع الحاسوب مقالاً لا وجود له على الإطلاق، فقد كان نادراً بشكل مفاجئ، حيث شكل أقل من 1 بالمائة من الأخطاء.

وإدراكاً منهم أن هذه الأخطاء الدقيقة يصعب على البشر اكتشافها دون فحص منهجي، اختبر الباحثون طريقة جديدة للتحقق تسمى "سلسلة التحقق" (Chain-of-Verification). يستخدم هذا النهج نموذج الحاسوب نفسه، ولكن بطريقة مختلفة. فبدلاً من مطالبة النموذج بمجرد سرد المراجع، يقوم النظام بتفكيك المهمة إلى سلسلة من الأسئلة الصغيرة والمستقلة. فهو يطلب من النموذج العثور على المقال بناءً على عنوانه ومؤلفه، ثم التحقق مما إذا كانت المجلة والسنة متطابقتين، وأخيراً التأكد من أن المعرف يشير إلى المستند الصحيح. ومن خلال إجبار النموذج على التحقق من كل قطعة من المعلومات بشكل منفصل مقابل قاعدة البيانات، بدلاً من الاعتماد على ذاكرته، يمكن للنظام رصد أخطائه بنفسه. وعندما اختبر الباحثون هذه الطريقة مقابل مجموعة من المراجع التي تم فحصها بعناية من قبل خبير بشري، أثبت النظام الآلي فعالية ملحوظة. فقد حدد بدقة 96.8 بالمائة من الاستشهادات الإشكالية، بما في ذلك كل حالة من حالات خطأ الإسناد والتزييف، بينما نادراً ما اعتبر استشهاداً صحيحاً خطأً.

خلصت الدراسة إلى أنه على الرغم من أن الجيل الجديد من أدوات الكتابة الطبية قوي، إلا أنه ليس جاهزاً بعد ليتم الوثوق به دون إشراف. الفشل الأكثر شيوعاً ليس اختراع حقائق وهمية، بل هو سوء تسمية الحقائق الحقيقية، وهو خطأ يتطلب نوعاً معيناً من الفحص للكشف عنه. وجد الباحثون أن عملية تحقق آلية يمكنها القيام بهذا الفحص بدقة تضاهي دقة الخبير البشري. وهذا يشير إلى أن مستقبل الكتابة الطبية المدعومة بالذكاء الاصطناعي لن يكون خياراً بين الإنسان والآلة، بل شراكة حيث تقوم الآلة بصياغة المحتوى ويضمن نظام تحقق متخصص أن كل استشهاد يشير إلى الحقيقة. وحتى يصبح هذا التحقق ممارسة قياسية، يجب التعامل مع الاستشهادات التي تولدها هذه النماذج بحذر، لأنها قد تقود القراء إلى المصدر الخاطئ للحقيقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →