← أحدث الأبحاث
📄 medicine

Performance, safety, and repeated-query stability of large language models versus early-career urologists in urological oncology: a source-masked vignette benchmark

تُظهر هذه الدراسة أنه في حين يتفوق أطباء المسالك البولية في بداية مسيرتهم المهنية بشكل ملحوظ على النماذج اللغوية الكبيرة الموجهة للمستهلكين في مجال أورام المسالك البولية من حيث الدقة الإجمالية، والسلامة، واستقرار الاستجابة، فإن الأخطاء المتكررة المتعلقة بالسلامة الحرجة والمخرجات غير المتسقة لهذه النماذج تؤكد على ضرورة الإشراف السريري بدلاً من النشر المستقل.

المؤلفون الأصليون: Ahmet Tüfekçi, Eyüp Kaplan, Özlem Başgut, Görkem Durna, Süleyman Sağır, Mehmet Sakıp Erturhan

نُشر 2026-09-10
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ahmet Tüfekçi, Eyüp Kaplan, Özlem Başgut, Görkem Durna, Süleyman Sağır, Mehmet Sakıp Erturhan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في ظل المشهد المتطور بسرعة للطب الحديث، بدأ الذكاء الاصطنا-عي في تقديم نوع جديد من المساعدة، وهو قادر على قراءة مكتبات ضخمة من المؤلفات الطبية والإجابة على الأسئلة المعقدة في ثوانٍ معدودة. تعمل هذه الأنظمة، المعروفة باسم نماذج اللغات الكبيرة، عن طريق التنبؤ بالكلمات الأكثر احتمالاً التي ستتبع نصاً معيناً، مما يسمح لها بتوليد استجابات متماسكة ومقنعة غالباً للسيناريوهات السريرية. بالنسبة للأطباء، تعد هذه التكنولوجيا أداة قوية لتنظيم المعلومات، والتحقق من الإرشادات، ودعم اتخاذ القرار. ومع ذلك، فإن المجال الطبي مبني على أساس من الدقة والسلامة، حيث يمكن لخطأ واحد في التقدير أن يؤدي إلى عواقب تغير مجرى الحياة. والسؤال الحاسم الذي يواجه المجتمع الطبي ليس فقط ما إذا كانت هذه الآلات قادرة على أن تبدو واسعة المعرفة، بل ما إذا كان يمكن الوثوق بها لاتخاذ قرارات آمنة ومتسقة وكاملة عندما تكون صحة المريض على المحك.

وللإجابة على ذلك، صمم فريق من الباحثين في تركيا اختباراً صارماً لمعرفة مدى كفاءة ثلاثة من أنظمة الذكاء الاصطناعي الشهيرة الموجهة للمستهلكين في عالم أورام المسالك البولية عالي المخاطر، والذي يتعامل مع سرطانات الجهاز البولي. لقد أنشأوا مائة قصة مريض تفصيلية وافتراضية، تغطي خمسة أنواع مختلفة من السرطان ومراحل مختلفة من الرعاية، من التشخيص الأولي إلى المتابعة طويلة الأمد. عُرضت هذه القصص على نماذج الذكاء الاصطناعي الثلاثة، وكذلك على اثنين من أطباء المسالك البولية في بداية مسيرتهم المهنية والذين أنهوا للتو تدريبهم المتخصص. لم يُسمح للأطباء والآلات بالبحث عن الإجابات أو استخدام موارد خارجية، كما تلقوا نفس التعليمات بالضبط. ثم قام خبيران مستقلان، لا يعرفان ما إذا كانت الإجابات من بشر أم من آلة، بتقييم كل استجابة بناءً على مجموعة صارمة من الإرشادات التي وضعتها الجمعية الأوروبية لأمراض المسالك البولية. بحث التقييم في أربعة أمور: ما إذا كانت النصيحة تتوافق مع الإرشادات الطبية الحالية، وما إذا كانت آمنة للمريض، وما إذا كانت تغطي جميع الخطوات الضرورية، وما إذا تم تحديد مرحلة المرض بشكل صحيح.

كشفت النتائج عن فجوة واضحة بين أداء الأطباء البشر وأنظمة الذكاء الاصطناعي. حقق طبيبا المسالك البولية في بداية مسيرتهما مستوى عالياً من النجاح، حيث قدما إجابات آمنة وكاملة في 85 و89 بالمائة من الحالات. وفي المقابل، نجحت نماذج الذكاء الاصطناعي في 60 إلى 70 بالمائة فقط من الحالات. وبينما أنتجت الآلات غالباً إجابات تبدو صحيحة على السطح، إلا أنها كثيراً ما أغفلت تفاصيل حاسمة أو فشلت في تضمين تحذيرات سلامة محددة رصدها الأطباء البشريون. وكانت النتيجة الأكثر إثارة للقلق تتعلق بسلامة المرضى؛ حيث احتوت حوالي حالة واحدة من كل أربع استجابات من أنظمة الذكاء الاصطناعي على خطأ قد يتسبب في ضرر جسيم، مثل التوصية بعلاج خطير على المريض أو إغفال علامة تحذيرية حرجة. وبالمقارنة، ارتكب الأطباء البشريون مثل هذه الأخطاء الحرجة المتعلقة بالسلامة في حالة أو حالتين فقط من بين كل مائة حالة.

وبعيداً عن دقة الإجابات، بحثت الدراسة أيضاً في مدى موثوقية أنظمة الذكاء الاصطناعي عند سؤالها نفس السؤال عدة مرات. في العالم الحقيقي، سيقدم الطبيب نفس النصيحة لنفس المريض في كل مرة يراجع فيها الحالة. وجد الباحثون أن نماذج الذكاء الاصطناعي كانت غير متسقة بشكل مثير للدهشة. فعندما طُلب من النظام نفس قصة المريض ثلاث مرات متتالية، أعطى النظام نفس التصنيف الدقيق للنجاح أو الفشل في أقل من نصف المرات. والأمر الأكثر إثارة للقلق هو أن النظام كان يعطي أحياناً إجابة آمنة في المحاولة الأولى، وإجابة غير آمنة في الثانية، وإجابة آمنة مرة أخرى في الثالثة. وهذا النقص في الاستقرار يعني أن مخرجات هذه الأدوات يمكن أن تتغير بشكل غير متوقع، مما يجعل من الصعب الاعتماد عليها للحصول على مشورة طبية متسقة.

وخلص الباحثون إلى أنه بينما يمكن لهذه الأنظمة من الذكاء الاصطناعي توليد معلومات مفيدة، إلا أنها ليست جاهزة بعد للعمل بشكل مستقل في بيئة سريرية. وتشير الدراسة إلى أن أفضل استخدام لهذه الأدوات في الوقت الحالي هو كمساعد تحت الإشراف، حيث يقوم طبيب بشري بمراجعة كل توصية قبل تطبيقها على المريض. يمكن للآلات المساعدة في تنظيم المعلومات أو اقتراح الخيارات، ولكن يجب أن تظل القرارات النهائية في أيدي البشر لضمان السلامة والاتساق. وحتى تتمكن هذه الأنظمة من مطابقة سجل الموثوقية والسلامة لدى المتخصصين البشر، يجب أن يكون دورها في رعاية مرضى السرطان داعماً وليس مستقلاً، بحيث تعمل كعين ثانية بدلاً من كونها صانع القرار الأساسي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →