← أحدث الأبحاث
💻 computer science

Evaluating Clinical Symptom Extraction and Reasoning in Local Large Language Models: A Proof-of-Concept Study of Symptom-Specific Performance in Cardiology

تقيم هذه الدراسة التجريبية نماذج لغوية كبيرة منشورة محلياً (Gemma3 وQwen3.5) على ملخصات خروج مرضى أمراض القلب باللغة اليابانية، حيث كشفت أنه بينما تبلغ دقة استخراج الأعراض الإجمالية مستويات عالية، إلا أن الأداء يتفاوت حسب عرض محدد، وغالباً ما تستنتج النماذج حالات مثل الخفقان أو التعب من النتائج السريرية الموضوعية بدلاً من الشكاوى الصريحة للمريض.

المؤلفون الأصليون: Shun Kitamura, Eisuke Amiya, Yoshihiro Izawa, Risa Kishikawa, Takenobu Shimada, Junichi Ishida, Satoshi Kodera, Norihiko Takeda

نُشر 2026-09-17
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Shun Kitamura, Eisuke Amiya, Yoshihiro Izawa, Risa Kishikawa, Takenobu Shimada, Junichi Ishida, Satoshi Kodera, Norihiko Takeda

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تنتج المستشات كميات هائلة من السجلات المكتوبة يومياً، بدءاً من الوصف الأولي لآلام المريض وصولاً إلى الملاحظات النهائية حول تعافيه. ويظل جزء كبير من هذه المعلومات محبوساً داخل فقرات نصية حرة التدفق، مما يجعل من الصعب فرزها أو البحث فيها أو تحليلها بسرعة. ولعقود من الزمن، اعتمد الأطباء والباحثون على الجهد اليدوي لقراءة هذه الملاحظات واستخراج تفاصيل محددة، وهي عملية بطيئة ومضنية وعرضة للخطأ البشري. ومؤخراً، ظهر نوع جديد من البرامج الحاسوبية يُعرف باسم "النماذج اللغوية الكبيرة" كحل محتمل. تم تدريب هذه الأنظمة على مكتبات ضخمة من النصوص، وهي قادرة على فهم اللغة البشرية بشكل جيد بما يكفي لقراءة ملاحظة طبية وتحديد حقائق محددة، مثل ما إذا كان المريض قد ذكر شعوره بضيق في التناو أو ألم في الصدر. ولأن هذه الأدوات يمكنها العمل بالكامل داخل أجهزة المستشفى الآمنة الخاصة دون إرسال بيانات خاصة إلى العالم الخارجي، فإنها تقدم طريقة واعدة لتحويل الملاحظات المكتوبة بخط اليد أو المطبوعة الفوضوية إلى بيانات منظمة ونظيفة يمكن استخدامها لتحسين رعاية المرضى.

وضع فريق من الباحثين في جامعة طوكيو هدفاً لاختبار مدى قدرة برنامجين حاسوبيين محليين على أداء هذه المهمة في المجال المحدد وعالي الخطورة المتمثل في فشل القلب. فقد ركزوا على المرضى الذين يعانون من فشل القلب المتقدم والذين يخضعون للتقييم من أجل زراعة القلب، وهي مجموعة تتسم أعراضها بالتعقيد والتنوع. اختار الباحثون عشر سجلات حقيقية لمرضى من مستشفاهم الخاص، تغطي الفترة ما بين عامي 2017 و2023. كُتبت هذه السجلات باللغة اليابانية وتضمنت القصة الكاملة لكل مريض خلال فترة إقامته في المستشفى، بما في ذلك شكواه، وما وجده الأطباء أثناء الفحوصات، وكيف تغيرت حالته بمرور الوقت. طلب الفريق من البرامج الحاسوبية فحص هذه القصص العشر وتحديد وجود أو غياب ثمانية أعراض محددة مطلوبة للإدراج في قائمة زراعة القلب، مثل خفقان القلب، والتعب الشديد، والإغماء. ولضمان دقة إجابات الكمبيوتر، قام خمسة من خبراء متخصصين في أمراض القلب بمراجعة القصص العشر نفسها بشكل مستقل واتفقوا على "الحقيقة الأرضية" (المرجع الصحيح) لكل عرض، مما خلق معياراً موثوقاً يمكن من خلاله قياس أداء الآلات.

اختبر الباحثون البرامج الحاسوبية تحت مجموعات مختلفة من التعليمات لمعرفة كيف يغير صياغة الطلب النتائج. في أحد السيناريوهات، طُلب من البرامج مسح التاريخ الطبي بأكمله بحثاً عن أي ذكر للأعراض. وفي سيناريو آخر، طُلب منها صراحةً تجاهل أي أعراض قد تكون ذُكرت في التاريخ الطبي للمريض والتركيز فقط على ما يحدث خلال فترة دخول المستشفى الحالية. كما اختبروا ما إذا كان طلب "التفكير بصوت عالٍ" من البرامج وشرح منطقها قبل إعطاء الإجابة سيؤدي إلى تحسين دقتها. ووجدت الدراسة أن كلا البرنامجين الحاسوبيين كانا جيدين بشكل عام في أداء المهمة، حيث حددا وجود الأعراض أو غيابها بشكل صحيح في معظم الحالات. ومع ذلك، لم يكن الأداء مثالياً، ولم تكن الأخطاء عشوائية؛ فقد واجهت البرامج صعوبة أكبر مع عرضين محددين: خفقان القلب (وهو الشعور بضربات قلب سريعة أو قوية)، والوهن (أو الشعور بالإرهاق الشديد).

وعندما فحص الباحثون الأخطاء التي ارتكبتها الحواسيب، اكتشفوا نمطاً واضحاً في طريقة تفكير الآلات. فبالنسبة لعرض خفقان القلب، قررت البرامج غالباً أن المريض يعاني منه لمجرد أن السجل الطبي أظهر اضطراباً في نظم القلب أو معدل ضربات قلب سريع، حتى لو لم يكتب المريض أو يقل فعلياً إنه يشعر بتسارع في ضربات قلبه. لقد استنتج الكمبيوتر العرض من البيانات الطبية الموضوعية بدلاً من الاعتماد على شكوى مباشرة من المريض. وبالمثل، بالنسبة للوهن، استنتجت البرامج بشكل متكرر أن المريض يشعر بالتعب لأن لديه فشلاً في القلب، وهو حالة معروفة بأنها تسبب التعب، حتى عندما لم تذكر الملاحظة المحددة كلمة "تعب" على الإطلاق. لقد قام الكمبيوتر بملء الفجوات باستخدام المنطق الطبي بدلاً من الالتزام الصارم بالنص. وكان هذا الميل قوياً لدرجة أنه في بعض الحالات، حدد الكمبيوتر بشكل صحيح أن المريض يعاني من عدم انتظام في ضربات القلب، ومع ذلك ادعى خطأً أن المريض يشعر بخفقان القلب، بينما في حالات أخرى مع نفس النتائج الطبية، قال بشكل صحيح إن المريض لا يشعر بها، مما أظهر تناقضاً في منطقه.

كما كشفت الدراسة أن طريقة صياغة التعليمات كانت مهمة بشكل كبير. فعندما أخبر الباحثون أحد البرامج بتجاهل التاريخ الطبي السابق والتركيز فقط على فترة الإقامة الحالية في المستشفى، أصبح البرنامج أكثر حذراً بشأن العثور على الأعراض، لكنه أخطأ أيضاً في العديد من الأعراض التي كانت موجودة بالفعل. لقد أصبح صارماً جداً بشأن تجاهل أي شيء لم يُكتب صراحةً في السياق الحالي لدرجة أنه فشل في رصد أعراض كانت جزءاً واضحاً من الحالة الحالية للمريض. وهذا يشير إلى أنه على الرغم من كون هذه البرامج الحاسوبية أدوات قوية، إلا أنها لا تقرأ الكلمات ببساطة كما يفعل البشر؛ بل هي تفسر النص بناءً على الارتباطات والأنماط الطبية التي تعلمتها. يمكنها استنتاج وجود عرض ما بناءً على حقائق أخرى، وهو أمر قد يكون مفيداً ولكنه يؤدي أيضاً إلى أخطاء عندما يكون هذا الاستنتاج خاطئاً. وأشار الباحثون إلى أن هذه النتائج تستند إلى عدد صغير من الحالات، وأن البرامج تصرفت بشكل مختلف بناءً على التعليمات المحددة المعطاة، مما يشير إلى أن هذه التكنولوجيا لا تزال في طور التطور.

في نهاية المطاف، يوضح هذا العمل أنه على الرغم من قدرة البرامج الحاسوبية المحلية على أتمتة استخراج المعلومات الطبية، إلا أنها لا تحل بعد مكان الحكم الدقيق للقارئ البشري. فالآلات قادرة على فهم سياق الملاحظة الطبية، لكنها أحياناً تترك معرفتها بكيفية عمل الأمراض تطغى على ما هو مكتوب فعلياً على الصفحة. ولكي تكون هذه الأدوات مفيدة حقاً في بيئة المستشفى، سيتعين على المطورين فهم كيفية استنتاج هذه البرامج للتشخيص بدقة، وكيفية توجيهها للاعتماد على شكاوى المرضى الصريحة بدلاً من الافتراضات الطبية. وتعد هذه الدراسة بمثابة إثبات للمفهوم، حيث تُظهر أن هذه الأنظمة يمكنها العمل داخل شبكة المستشفى الآمنة والتعامل مع النصوص الطبية المعقدة، ولكنها تسلط الضوء أيضاً على الحاجة إلى الإشراف الدقيق لضمان بقاء عملية استخراج الأعراض الآلية دقيقة وموثوقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →