Automated Identification of Complex Percutaneous Coronary Intervention from Cardiac Catheterization Reports Using Large Language Models
تُثبت هذه الدراسة أن النماذج اللغوية الكبيرة مفتوحة المصدر ذات السعة العالية، ولا سيما Llama 3.3 70B، يمكنها تحديد إجراءات التدخل التاجي عبر الجلد المعقدة واستخراج المتغيرات الرئيسية من تقارير قسطرة القلب المكتوبة بنصوص حرة بدقة وتلقائية، مما يوفر بديلاً قابلاً للتوسع لعمليات التجريد اليدوية كثيفة العمالة في أبحاث القلب والأوعية الدموية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل
تنتج المستشفيات كميات هائلة من النصوص غير المنظمة يومياً. ومن بين أكثر هذه الوثائق أهمية هي التقارير السردية التي تُكتب بعد عملية قسطرة القلب، وهي إجراء يقوم فيه الأطباء بتمرير أنبوب رفيع عبر الشرايين لفحص الأوعية الدموية للقلب. هذه التقار تقنية غنية بالتفاصيل حول تشريح قلب المريض والتقنيات المحددة المستخدمة لإصلاح الانسدادات، ولكنها تُكتب في فقرات حرة التدفق بدلاً من حقول منظمة بنظام "الاختيار من متعدد". وبالنسبة للباحثين وفرق تحسين الجودة، يشكل هذا عائقاً كبيراً؛ فلدراسة مدى فعالية هذه الإجراءات أو لتتبع تعقيد الحالات عبر نظام صحي ما، يجب على الخبراء البشريين قراءة آلاف التقارير يدوياً واستخراج نقاط بيانات محددة. هذه العملية بطيئة، ومكلفة، ويصعب توسيع نطاقها، مما يحد غالباً من حجم وسرعة الدراسات الطبية الهامة.
يوفر صعود النماذج اللغوية الكبيرة، وهي نوع من الذكاء الاصطناعي القادر على فهم وتوليد نصوص تشبه النصوص البشرية، حلاً محتملاً لهذه المشكلة. يمكن تدريب هذه الأنظمة لقراءة الوثائق المعقدة واستخراج حقائق محددة، تماماً مثل مساعد بحث سريع ولا يكل. ومع ذلك، ظل من غير الواضح ما إذا كانت هذه الأدوات قادرة على التعامل مع اللغة المتخصصة والدقيقة الموجودة في ملاحظات إجراءات القلب، خاصة عند مطالبتها بتحديد الحالات "المعقدة" التي تتضمن انسدادات متعددة أو تقنيات صعبة. وقد وضع فريق من الباحثين نصب أعينهم اختبار هذا السؤال باستخدام مجموعة كبيرة من تقارير قسطرة القلب الواقعية.
جمع الباحثون 1,412 ملاحظة إجراء منزوعة الهوية من ثلاثة مستشفيات مختلفة ضمن نظام "ييل نيو هيفن" الصحي. غطت هذه الوثائق إجراءات أُجريت بين عامي 2011 و2017، وشملت مزيجاً من الفحوصات التشخيصية والتدخلات الفعلية حيث استخدم الأطباء الدعامات أو البالونات لفتح الشرايين المسدودة. ولإنشاء معيار موثوق للمقارنة، قام مجموعة من المتخصصين في أمراض القلب بقراءة كل ملاحظة يدوياً. حددوا أولاً ما إذا كان التقرير يصف إجراءً استُخدم فيه بالفعل دعامة أو بالون لعلاج شريان تاجي. وبالنسبة لتلك الحالات، استخرجوا ستة تفاصيل محددة تحدد الإجراء "المعقد": عدد الأوعية الدموية التي تم علاجها، عدد الانسدادات المتميزة التي تم إصلاحها، إجمالي عدد الدعامات الموضوعة، ما إذا كانت تقنية معينة تعتمد على دعامتين قد استُخدمت لوعاء متفرع، الطول الإجمالي لجميع الدعامات مجتمعة، وما إذا كان قد تم علاج انسداد كلي مزمن — وهو انسداد كامل وطويل الأمد.
ومع وجود هذا "المعيار الذهبي" الذي تم التحقق منه بشرياً، اختبر الفريق ثلاثة نماذج مختلفة من الذكاء الاصطناعي لمعرفة ما إذا كان بإمكانها محاكاة عمل الخبراء. اختاروا نماذج مفتوحة المصدر، مما يعني أن كودها وأوزانها متاحة للجمهور، وهو ما سمح للباحثين بتشغيلها على أجهزة كمبيوتر محلية آمنة لحماية خصوصية المرضى. كان أحد النماذج عبارة عن نظام ضخم للأغراض العامة يحتوي على 70 مليار معلمة (parameter)، وهو مقياس لحجمه وقدرته على الاستنتاج. أما النموذجان الآخران فكانا أصغر حجماً وتم تدريبهما مسبقاً بشكل خاص على الأدبيات الطبية، حيث يمتلك كل منهما 7 مليارات معلمة، وصُمما لفهم المصطلحات السريرية. قام الباحثون بتغذية نفس النصوص والمطالبات والتقارير للنماذج الثلاثة، طالباً منها تحديد ما إذا كان الإجراء قد حدث واستخراج المتغيرات الستة المحددة.
أظهرت النتائج فرقاً واضحاً في القدرة. فقد تفوق النموذج الضخم ذو الأغراض العامة بشكل كبير على النموذجين الأصغر المتخصصين طبياً. فعندما طُلب منه ببساطة تحديد ما إذا كان التقرير يصف إجراءً للقلب، حقق النموذج الكبير حساسية مثالية، مما يعني أنه لم يخطئ في أي إجراء فعلي، كما حدد الإجراءات غير الموجودة بدقة عالية. في المقابل، واجهت النماذج الأصغر صعوبة؛ حيث أخطأ أحدها في اعتبار ملاحظات غير متعلقة بالإجراءات كأنها إجراءات، بينما فشل الآخر في التعرف على الإجراءات الفعلية بشكل شبه كامل.
واتسعت الفجوة عندما تطلب الأمر استخراج التفاصيل الستة المعقدة. نجح النموذج الكبير في تحديد عدد الدعامات وإجمالي طول الدعامات بدقة عالية جداً، غالباً ما تجاوزت 90 بالمائة. كما كان أداؤه جيداً في تحديد عدد الأوعية المعالجة. ومع ذلك، انخفض أداؤه في المتغيرات التي تتطلب تفسيراً أكبر، مثل عد العدد الدقيق للانسدادات المتميزة أو تحديد ما إذا كانت تقنية معينة تعتمد على دعامتين قد استُخدمت لوعاء متفرع. في هذه الحالات، أخطأ النموذج أحياناً في بعض التفاصيل أو أساء تفسير السياق، رغم أنه ظل أكثر دقة بكثير من النماذج الأصغر. أما النماذج الطبية الأصغر، وبالرغم من تدريبها المتخصص، فقد فشلت في استخراج هذه التفاصيل باستمرار، وغالباً ما أنتجت نتائج غير موثوقة بما يكفي للاستخدام البحثي.
كما بحثت الدراسة فيما إذا كانت النماذج تعمل بشكل مختلف عبر مواقع المستشفيات الثلاثة. وبينما حافظ النموذج الكبير على دقة عالية في جميع المواقع، كانت هناك اختلافات ملحوظة في مستوى أدائه في كل موقع، ويرجع ذلك على الأرجح إلى الاختلافات في كيفية كتابة الأطباء لملاحظاتهم في كل مستشفى. وأظهرت النماذج الأصغر عدم اتساق أكبر، حيث تذبذب أداؤها بشكل حاد اعتماداً على الموقع. وهذا يشير إلى أنه على الرغم من قوة النموذج الكبير، إلا أن طريقة توثيق المعلومات لا تزال قادرة على التأثير في النتائج.
حلل الباحثون الأخطاء التي ارتكبها النموذج الأفضل أداءً لفهم مواضع تعثره. ووجدوا أن الأخطاء كانت تحدث غالباً عندما يكون التوثيق غامضاً أو مجزأً. فعلى سبيل المثال، خلط النموذج أحياناً بين اختبار تشخيصي وعلاج، أو واجه صعوبة في التمييز بين دعامة تم وضعها بنجاح ودعامة جرت محاولة وضعها ولكن لم يتم نشرها. كما واجه صعوبة عندما ذكر التقرير انسداداً لم يتم علاجه فعلياً، أو عندما كان وصف الانسداد الكلي المزمن ضمنياً وليس مذكوراً صراحة. تسلط هذه الأخطاء الضوء على أنه بينما تعد هذه التكنولوجيا قوية، إلا أنها ليست مثالية بعد في التعامل مع الواقع الفوضوي وغير المتسق للكتابة الطبية البشرية.
في الختام، تثبت الدراسة أن نموذج ذكاء اصطناعي ضخم ومفتوح المصدر يمكنه استخراج بيانات معقدة من تقارير إجراءات القلب غير المنظمة، وهي مهمة كانت تتطلب تقليدياً ساعات من العمل اليدوي. وتشير النتائج إلى أنه بالنسبة للعديد من المتغيرات، وخاصة تلك المذكورة صراحة مثل عدد الدعامات، يمكن لهذه الأدوات تحقيق مستوى من الدقة مناسباً للبحث. ومع ذلك، بالنسبة للمتغيرات التي تتطلب تفسيراً سياقياً عميقاً، لا تزال التكنولوجيا تواجه تحديات. ويشير العمل إلى أن مستقبل أبحاث القلب والأوعية الدموية القابلة للتوسع قد يكمن في استخدام هذه النماذج القوية للتعامل مع الجزء الأكبر من استخراج البيانات، مع إمكانية الجمع بينها وبين الإشراف البشري للحالات الأكثر صعوبة، بدلاً من الاعتماد فقط على النماذج الأصغر المتخصصة أو المراجعة اليدوية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.