Performance, safety, and repeated-query stability of large language models versus early-career urologists in urological oncology: a source-masked vignette benchmark
تُظهر هذه الدراسة أنه في حين يتفوق أطباء المسالك البولية في بداية مسيرتهم المهنية بشكل ملحوظ على النماذج اللغوية الكبيرة الموجهة للمستهلكين في مجال أورام المسالك البولية من حيث الدقة الإجمالية، والسلامة، واستقرار الاستجابة، فإن الأخطاء المتكررة المتعلقة بالسلامة الحرجة والمخرجات غير المتسقة لهذه النماذج تؤكد على ضرورة الإشراف السريري بدلاً من النشر المستقل.
المؤلفون الأصليون:Ahmet Tüfekçi, Eyüp Kaplan, Özlem Başgut, Görkem Durna, Süleyman Sağır, Mehmet Sakıp Erturhan
في ظل المشهد المتطور بسرعة للطب الحديث، بدأ الذكاء الاصطنا-عي في تقديم نوع جديد من المساعدة، وهو قادر على قراءة مكتبات ضخمة من المؤلفات الطبية والإجابة على الأسئلة المعقدة في ثوانٍ معدودة. تعمل هذه الأنظمة، المعروفة باسم نماذج اللغات الكبيرة، عن طريق التنبؤ بالكلمات الأكثر احتمالاً التي ستتبع نصاً معيناً، مما يسمح لها بتوليد استجابات متماسكة ومقنعة غالباً للسيناريوهات السريرية. بالنسبة للأطباء، تعد هذه التكنولوجيا أداة قوية لتنظيم المعلومات، والتحقق من الإرشادات، ودعم اتخاذ القرار. ومع ذلك، فإن المجال الطبي مبني على أساس من الدقة والسلامة، حيث يمكن لخطأ واحد في التقدير أن يؤدي إلى عواقب تغير مجرى الحياة. والسؤال الحاسم الذي يواجه المجتمع الطبي ليس فقط ما إذا كانت هذه الآلات قادرة على أن تبدو واسعة المعرفة، بل ما إذا كان يمكن الوثوق بها لاتخاذ قرارات آمنة ومتسقة وكاملة عندما تكون صحة المريض على المحك.
وللإجابة على ذلك، صمم فريق من الباحثين في تركيا اختباراً صارماً لمعرفة مدى كفاءة ثلاثة من أنظمة الذكاء الاصطناعي الشهيرة الموجهة للمستهلكين في عالم أورام المسالك البولية عالي المخاطر، والذي يتعامل مع سرطانات الجهاز البولي. لقد أنشأوا مائة قصة مريض تفصيلية وافتراضية، تغطي خمسة أنواع مختلفة من السرطان ومراحل مختلفة من الرعاية، من التشخيص الأولي إلى المتابعة طويلة الأمد. عُرضت هذه القصص على نماذج الذكاء الاصطناعي الثلاثة، وكذلك على اثنين من أطباء المسالك البولية في بداية مسيرتهم المهنية والذين أنهوا للتو تدريبهم المتخصص. لم يُسمح للأطباء والآلات بالبحث عن الإجابات أو استخدام موارد خارجية، كما تلقوا نفس التعليمات بالضبط. ثم قام خبيران مستقلان، لا يعرفان ما إذا كانت الإجابات من بشر أم من آلة، بتقييم كل استجابة بناءً على مجموعة صارمة من الإرشادات التي وضعتها الجمعية الأوروبية لأمراض المسالك البولية. بحث التقييم في أربعة أمور: ما إذا كانت النصيحة تتوافق مع الإرشادات الطبية الحالية، وما إذا كانت آمنة للمريض، وما إذا كانت تغطي جميع الخطوات الضرورية، وما إذا تم تحديد مرحلة المرض بشكل صحيح.
كشفت النتائج عن فجوة واضحة بين أداء الأطباء البشر وأنظمة الذكاء الاصطناعي. حقق طبيبا المسالك البولية في بداية مسيرتهما مستوى عالياً من النجاح، حيث قدما إجابات آمنة وكاملة في 85 و89 بالمائة من الحالات. وفي المقابل، نجحت نماذج الذكاء الاصطناعي في 60 إلى 70 بالمائة فقط من الحالات. وبينما أنتجت الآلات غالباً إجابات تبدو صحيحة على السطح، إلا أنها كثيراً ما أغفلت تفاصيل حاسمة أو فشلت في تضمين تحذيرات سلامة محددة رصدها الأطباء البشريون. وكانت النتيجة الأكثر إثارة للقلق تتعلق بسلامة المرضى؛ حيث احتوت حوالي حالة واحدة من كل أربع استجابات من أنظمة الذكاء الاصطناعي على خطأ قد يتسبب في ضرر جسيم، مثل التوصية بعلاج خطير على المريض أو إغفال علامة تحذيرية حرجة. وبالمقارنة، ارتكب الأطباء البشريون مثل هذه الأخطاء الحرجة المتعلقة بالسلامة في حالة أو حالتين فقط من بين كل مائة حالة.
وبعيداً عن دقة الإجابات، بحثت الدراسة أيضاً في مدى موثوقية أنظمة الذكاء الاصطناعي عند سؤالها نفس السؤال عدة مرات. في العالم الحقيقي، سيقدم الطبيب نفس النصيحة لنفس المريض في كل مرة يراجع فيها الحالة. وجد الباحثون أن نماذج الذكاء الاصطناعي كانت غير متسقة بشكل مثير للدهشة. فعندما طُلب من النظام نفس قصة المريض ثلاث مرات متتالية، أعطى النظام نفس التصنيف الدقيق للنجاح أو الفشل في أقل من نصف المرات. والأمر الأكثر إثارة للقلق هو أن النظام كان يعطي أحياناً إجابة آمنة في المحاولة الأولى، وإجابة غير آمنة في الثانية، وإجابة آمنة مرة أخرى في الثالثة. وهذا النقص في الاستقرار يعني أن مخرجات هذه الأدوات يمكن أن تتغير بشكل غير متوقع، مما يجعل من الصعب الاعتماد عليها للحصول على مشورة طبية متسقة.
وخلص الباحثون إلى أنه بينما يمكن لهذه الأنظمة من الذكاء الاصطناعي توليد معلومات مفيدة، إلا أنها ليست جاهزة بعد للعمل بشكل مستقل في بيئة سريرية. وتشير الدراسة إلى أن أفضل استخدام لهذه الأدوات في الوقت الحالي هو كمساعد تحت الإشراف، حيث يقوم طبيب بشري بمراجعة كل توصية قبل تطبيقها على المريض. يمكن للآلات المساعدة في تنظيم المعلومات أو اقتراح الخيارات، ولكن يجب أن تظل القرارات النهائية في أيدي البشر لضمان السلامة والاتساق. وحتى تتمكن هذه الأنظمة من مطابقة سجل الموثوقية والسلامة لدى المتخصصين البشر، يجب أن يكون دورها في رعاية مرضى السرطان داعماً وليس مستقلاً، بحيث تعمل كعين ثانية بدلاً من كونها صانع القرار الأساسي.
ملخص تقني: الأداء، والسلامة، واستقرار الاستعلامات المتكررة للنماذج اللغوية الكبيرة مقابل أطباء المسالك البولية في بداية مسيرتهم المهنية
بيان المشكلة بينما يتم تقييم النماذج اللغوية الكبيرة (LLMs) بشكل متزايد لدعم القرار الطبي، فإن مقاييس الدقة الإجمالية غالباً ما تحجب الأخطاء الجراحية أو التبعات الخطيرة والتباين عبر الاستعلامات المتكررة. في مجال أورام المسالك البولية، حيث تعتمد الإدارة العلاجية على التكامل الدقيق بين مرحلة المرض، ومجموعات الخطورة، والمتغيرات الخاصة بالمريض، فإن الأداء العالي في أسئلة المعرفة المعيارية لا يضمن اتخاذ قرار سريري موثوق وحساس للسياق. تشير الدراسات الحالية إلى أن النماذج اللغوية الكبيرة قد تفشل في تلبية معاي�ının عدم الدونية (non-inferity) مقارنة بهيئات الأورام متعددة التخصصات، كما أن الأخطاء الحرجة المتعلقة بالسلامة قد تستمر حتى عندما يبدو الأداء العام مقبولاً. علاوة على ذلك، لا يزال استقرار مخرجات النماذج اللغوية الكبيرة — أي ما إذا كان تكرار الاستعلام يؤدي إلى نفس التصنيف أو التوصية — أمراً غير مستكشف كبعد مستقل للموثوقية السريرية.
المنهجية استخدمت هذه الدراسة اختباراً معيارياً مقارناً، عرضياً، وقائماً على السيناريوهات السريرية (vignettes)، لتقييم ثلاثة من النماذج اللغوية الكبيرة الموجهة للمستهلكين مقابل اثنين من أطباء المسالك البولية في بداية مسيرتهم المهنية كعناصر مقارنة.
تصميم الاختبار المعياري: استخدمت الدراسة 100 سيناريو سريري اصطناعي تغطي خمسة أنواع من سرطانات المسالك البولية (البروستاتا، المثانة، سرطان الخلايا الكلوية، سرطان الخصية، وسرطان المسالك البولية العلوية) وخمس فئات قرار (التشخيص/التصنيف، تصنيف الخطورة، العلاج الأولي، التسلسل العلاجي، والمتابعة/السلامة).
المقارنون البشريون: طبيبان من أطباء المسالك البولية في بداية مسيرتهم المهنية (أحدهما بخبرة تقارب سنة والآخر بخبرة تقارب 3 أشهر بعد التخصص).
المقيمون: اثنان من أطباء المسالك البولية المختصين في أورام المسالك البولية (أستاذ وأستاذ مشارك)، قاموا بتقييم جميع الـ 500 استجابة بشكل مستقل مع إخفاء المصدر.
الشروط: أجاب جميع المصادر على الـ 100 سيناريو باستخدام مطالبة (prompt) معيارية متطابقة باللغة الإنجليزية دون استخدام موارد خارجية، أو تصفح الإنترنت، أو التصحيح التكراري.
إطار التقييم: تم تقييم الاستجابات مقابل إطار عمل محدد مسبقاً لعام 2025 يعتمد على معاي ever الجمعية الأوروبية لأمراض المسالك البولية (EAU) عبر أربعة مجالات: التوافق مع الإرشادات، السلامة السريرية، اكتمال القرار، ودقة الخطورة/المرحلة.
الهدف الرئيسي: "نجاح مركب" ثنائي يتطلب الحصول على درجة ≥2 في المجالات الأربعة مع غياب أي خطأ سريري استبعادي محدد مسبقاً.
هدف السلامة: تقييم منفصل لـ "الأخطاء الحرجة للسلامة" والتي عُرِّفت بأنها الأخطاء التي يمكن أن تسبب ضرراً جسيماً، أو نقصاً كبيراً في العلاج، أو الفشل في إدراك الضرورة الملحة.
التحليل الإحصائي: استخدمت المقارنات اختبار Cochran's Q للاختلافات الإجمالية واختبار McNemar للمقارنات الزوجية، مع تطبيق تعديل Holm لتعدد الاختبارات. تم تقدير أحجام التأثير عبر إعادة أخذ العينات غير المعلمية (nonparametric bootstrap resampling).
النتائج الرئيسية
النجاح المركب الأولي: تفوق أطباء المسالك البولية في بداية مسيرتهم المهنية بشكل ملحوظ على النماذج اللغوية الكبيرة. حقق الطبيب (أ) نسبة نجاح 85.0%، والطبيب (ب) 89.0%. في المقابل، كانت معدلات نجاح النماذج اللغية الكبيرة هي 70.0% (GPT-5.2)، و64.0% (Claude)، و60.0% (Gemini). لم يظل الفرق بين الطبيب (أ) وGPT-5.2 معنوياً بعد تعديل Holm (القيمة المعدلة P = 0.095)، لكن جميع المقارنات الأخرى بين البشر والنماذج اللغوية الكبيرة كانت معنوية.
الأخطاء الحرجة للسلامة: لوحظ تفاوت صارخ في السلامة. سجلت النماذج اللغوية الكبيرة أخطاء حرجة للسلامة في 25.0% (GPT-5.2)، و25.0% (Claude)، و26.0% (Gemini) من الاستجابات. بينما سجل الأطباء أخطاء في 2.0% و1.0% فقط من الحالات، على التوالي. ظلت جميع مقارنات البشر مقابل النماذج اللغوية الكبيرة فيما يخص السلامة معنوية بعد التعديل.
أنماط الأخطاء: كان الخطأ الأكثر تكراراً في النماذج اللغوية الكبيرة هو إغفال عامل يغير الإدارة العلاجية (CE-6)، يليه إغفال التشخيص/المرحلة ونقص العلاج. وقعت التوصيات الضارة أو المحظورة (CE-9) في استجابة واحدة لـ GPT-5.2، و3 لاستجابات لـ Claude، و3 لاستجابات لـ Gemini (1%، 3%، و3% على التوالي)، ولم تقع لدى أي من الأطباء المقارنين.
استقرار الاستعلام المتكرر: كان الاستقرار محدوداً. عبر 60 مزيجاً من السيناريوهات والمنصات، كان الاستقرار في ثلاث جولات متتالية للتصنيف الأولي هو 45.0%، ولحالة السلامة 48.3%. حافظ 28.3% فقط من المزيج على استقرار ملف تعريف الدرجات الكامل للأربعة مجالات. ومن الجدير بالذكر أن الاستقرار شمل أيضاً المخرجات الناجحة باستمرار والمخرسات (أو غير الآمنة) باستمرار.
المساهمات الرئيسية
الفصل بين الأداء والموثوقية: توضح الدراسة أن مقاييس الأداء الإجمالية لا تلتقط تماماً موثوقية الاستجابة. يمكن أن يتعايش متوسط الدرجات المرتفع مع عبء عالٍ من الأخطاء الحرجة للسلامة وانخفاض القدرة على التكرار.
التقييم المحكوم بالسلامة: من خلال تعريف الأخطاء الحرجة للسلامة بشكل منفصل عن التوافق العام مع الإرشادات، تسلط الدراسة الضوء على أن النماذج اللغوية الكبيرة غالباً ما تولد استجابات "مقبولة على نطاق واسع" من حيث الهيكل، ولكنها خطيرة سريرياً بسبب إغفالات محددة أو توصيات محظورة.
الاستقرار كمعيار سريري: يحدد البحث عدم استقرار النماذج اللغوية الكبيرة الموجهة للمستهلكين، موضحاً أن تكرار الاستعلام غالباً ما يغير التصنيف السريري أو حالة السلامة، وهو عامل لا تلتقطه مقاييس التكرار القائمة على الارتباط.
التقييم بنظام إخفاء المصدر: يوفر استخدام تصميم متوازن مع إخفاء المصدر وتقييم من قبل خبراء أورام المسالك البولية مقارنة صارمة بين الذكاء الاصطناً الاستهلاكي الحالي والأطباء في بداية مسيرتهم المهنية في تخصص دقيق ومعقد.
الأهمية والادعاءات تخلص الورقة إلى أنه بينما تولد النماذج اللغوية الكبيرة الموجهة للمستهلكين غالباً استجابات مقبولة للسيناريوهات الاصطناعية لأورام المسالك البولية، إلا أنها تظهر حالياً معدلاً ذا صلة سريرية من الأخطاء الحرجة للسلامة وموثوقية محدودة. تشير النتائج إلى أن هذه النماذج ليست جاهزة بعد للاستخدام السريري المستقل. بدلاً من ذلك، تدعم النتائج نموذج الدعم الخاضع لإشراف الطبيب، حيث تُعامل مخرجات النماذج اللغوية الكبيرة كمسودات اقتراح يجب التحقق منها مقابل السياق السريري الكامل والإرشادات الحالية.
يؤكد المؤلفون على وجوب تقييم الأداء، والخطأ ذو التبعات، والتكرار كأبعاد منفصلة للموثوقية. ويدعون إلى دمج نقاط النهاية المحكومة بالسلامة ومقاييس استقرار الاستعلام المتكرر جنباً إلى جنب مع مقاييس الدقة التقليدية في التقييمات المستقبلية عالية المخاطر. وتتجنب الدراسة صراحةً ادعاء التفوق على مستوى السكان للمقارنين البشريين المحددين، مشيرة إلى أن شخصين لا يمكنهما تمثيل مجتمع الأطباء الأوسع، لكن اتجاه النتائج يتماشى مع الدراسات الأخرى التي تظهر صعوبة النماذج اللغوية الكبيرة في التعامل مع القرارات المعقدة والحساسة للسياق في مجال الأورام.