Can Large Language Models Diagnose Primary Immunodeficiency from Patient-Described Symptoms?
تكشف هذه الدراسة أنه بينما تستطيع النماذج اللغوية الكبيرة تحديد نقص المناعة الأولي بفعالية من خلال السير المرضية التي يكتبها الأطباء، فإن دقتها التشخيصية تنخفض بشكل كبير عند الاعتماد على أوصاف المرضى لأعراضهم، مما يسلط الضوء على فجوة حرجة في الأداء بناءً على لغة وصياغة المدخلات الطبية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل
بالنسبة لملايين الأشخاص، لا يعد المسار نحو التشخيص الطبي خطاً مستقيماً، بل رحلة طويلة ومربكة. وينطبق هذا بشكل خاص على أولئك الذين يعانون من حالات نادرة، حيث قد تكون الأعراض غامضة، أو شائعة، أو يسهل الخلط بينها وبين شيء آخر. في السنوات الأخيرة، لجأ العديد من هؤلاء الأفراد إلى نوع جديد من المساعدين: النماذج اللغوية الكبيرة. هذه البرامج الحاسوبية المتقدمة مدربة على كميات هائلة من النصوص، وهي قادرة على إجراء محادثات والإجابة على أسئلة تتعلق بالصحة. لقد أصبحت مورداً أساسياً للأشخاص الذين يحاولون فهم أجسادهم، غالباً قبل أن يقابلوا أخصائياً. لكن يبقى سؤال جوهري: هل يمكن لهذه الأدوات الرقمية أن تفهم المريض حقاً عندما يكون المريض هو من يصف المشكلة؟ تعتمد الإجابة بشكل كبير على من يتحدث. فعندما يلخص الطبيب حالة باستخدام مصطلحات طبية دقيقة، يفهم الكمبيوتر الأمر بشكل مثالي. أما عندما يصف شخص عادي ألمه، أو تعبه، أو التهاباته المتكررة بلغة يومية، فإن الكمبيوتر غالباً ما يضل الطريق.
وضع فريق من الباحثين هدفاً لاختبار هذه الفجوة بين لغة الخبراء ولغة المرضى، مع التركيز على مجموعة من الاضطرابات النادرة المعروفة باسم نقص المناعة الأولي. هذه هي الحالات التي يكون فيها نظام الدفاع الطبيعي في الجسم، والذي يحارب الجراثيم عادةً، معطلاً أو مفقوداً. يصاب المصابون بهذه الحالات بالمرض بشكل متكرر، وأحياناً بتهابات شديدة تتطلب دخول المستشفى، ويواجهون خطراً كبيراً للإصابة بمضاعفات أخرى مثل أمراض المناعة الذاتية. ولأن هذه الحالات نادرة ومعقدة، غالباً ما ينتظر المرضى سنوات للحصول على تشخيص صحيح، وهو تأخير قد يكون خطيراً ومرهقاً عاطفياً. وخلال فترة الانتظار هذه، يلجأ الكثيرون إلى برامج الدردشة الآلية (Chatbots) بحثاً عن إجابات. أراد الباحثون معرفة ما إذا كانت هذه البرامج يمكنها رصد علامات خلل في الجهاز المناعي عندما يكون الوصف قادماً مباشرة من المريض، وليس من طبيب.
ولمعرفة ذلك، جمع الباحثون قصصاً من واحد وعشرين بالغاً تم تشخيص إصابتهم بالفعل بنقص المناعة الأولي. كان جميع هؤلاء الأفراد قد مروا بتأخيرات طويلة في الحصول على تشخيصهم. طلب منهم الفريق وصف الأعراض الأولى التي جعلتهم يشعرون بأن هناك خطباً ما. أخذ الباحثون هذه الأوصاف الخام وغير المحررة — تماماً كما قالها المرضى، بكل ما فيها من تردد وتكرار وكلمات يومية — وغذوا بها نموذجاً لغوياً كبيراً وقوياً. قاموا بإزالة أي ذكر للتشخيص النهائي حتى يضطر الكمبيوتر للاعتماد على الأعراض وحدها. كان الهدف بسيطاً: هل سيقترح الكمبيوتر أن المريض قد يعاني من نقص المناعة الأولي، أو على الأقل سيتعرف على أن جهاز المناعة لديه هو المشكلة؟
كشفت النتالئج عن فرق صارخ بين كيفية أداء الكمبيوتر مع مدخلات الخبراء مقابل مدخلات المرضى. في دراسة سابقة استخدمت نفس النموذج الحاسوبي، عندما كتب الأطباء التاريخ المرضي للمرضى باستخدام لغة طبية احترافية، حدد الكمبيوتر الحالة بشكل صحيح في 96% من الحالات؛ لقد كان أداؤه مثالياً تقريباً. ومع ذلك، عندما استخدم الباحثون كلمات المرضى الخاصة، انخفض أداء الكمبيوتر بشكل كبير. فقد حدد نقص المناعة الأولي بشكل صحيح في سبع حالات فقط من أصل واحد وعشرين حالة، أي حوالي الثلث. فشل الكمبيوتر في تسمية الحالة المحددة في غالبية الحالات، رغم أن المرضى كانوا يصفون الأمراض ذاتها بالضبط.
وعلى الرغم من عدم تحديد التشخيص بدقة، إلا أن الكمبيوتر لم يكن غير مفيد تماماً. ففي سبع عشرة حالة من أصل واحد وعشرين، اقترح أن المريض قد يعاني من مشكلات عامة في الجهاز المناعي، حتى لو لم يسمِّ المرض النادر المحدد. وهذا اكتشاف مهم لأنه يشير إلى أن الأداة لا تزال قادرة على العمل كإشارة مفيدة. فبالنسبة لمريض أخبره عدة أطباء أن أعراضه مجرد توتر أو حساسية، فإن اقتراح الكمبيوتر بوجود "مشكلات في الجهاز المناعي" قد يشجعه على البحث عن أخصائي. ومع ذلك، أظهرت الدراسة أيضاً أن الكمبيوتر غالباً ما خمن حالات أخرى أكثر شيوعاً؛ فقد اقترح تكراراً وجود حالات حساسية، أو عوامل بيئية مثل جودة الهواء الضعيفة، أو مشاكل في الغدد الصماء مثل مشاضاء الغدة الدرقية. هذه هي الأمور التي ينظر إليها الأطباء أولاً، ولكنها يمكن أن تكون أيضاً طرقاً مسدودة لشخص يعاني في الواقع من اضطراب مناعي نادر.
وجد الباحثون أن الكمبيوتر كان أكثر عرضة لتشخيص الحالة بشكل صحيح عندما تضمنت قصة المريض ثلاث إشارات محددة: الالتهابات التي بدأت في مرحلة الطفولة، أو الالتهابات الخطيرة جداً التي استدعت دخول المستشفى، أو الأعراض التي لم تكن التهابات على الإطلاق، مثل الفشل في النمو أو مشاكل الجهاز الهضمي. عندما وصف المرضى معاناتهم بهذه الطرق الواضحة والكلاسيكية، كانت لدى الكمبيوتر فرصة أفضل لربط النقاط ببعضها. ولكن عندما كانت الأوصاف أكثر دقة أو تركز على الشعور العام بالاعتلال، واجه الكمبيوتر صعوبة. يسلط هذا الضوء على ضعف جوهري: الأداة حساسة للغاية لكيفية سرد القصة. فهي تزدهر باللغة المنظمة والدقيقة للطب، لكنها تتعثر أمام الطريقة الفوضوية والعاطفية والمتنوعة التي يتحدث بها الناس فعلياً عن صحتهم.
يشير مؤلفو الدراسة بحذر إلى أن هذا ليس حكماً نهائياً على سلامة أو فائدة هذه الأدوات، بل هو تحذير بشأن كيفية استخدامها حالياً. ويشيرون إلى أن اختبارهم كان في أفضل السيناريوهات؛ فالمرضى الذين قابلهم الباحثون يعرفون تشخيصهم بالفعل، وقد يتذكرون أعراضهم بوضوح أكبر مما قد يكون عليه الحال في بداية مرضهم. وإذا كان الكمبيوتر يؤدي بهذا السوء مع الروايات الاسترجاعية الواضحة، فقد يكون أداؤه أسوأ مع المرضى الذين يعيشون حالة من الارتباك قبل التشخيص والذين لا يعرفون ما الذي أصابهم. علاوة على ذلك، لم تختبر الدراسة عدد المرات التي قد يعطي فيها الكمبيوتر إنذارات خاطئة لأشخاص أصحاء، وهو أمر يثير قلقاً كبيراً. فإذا قامت الأداة بتصنيف الكثير من الأصحاء على أن لديهم مشكلات مناعية، فقد يؤدي ذلك إلى إرهاق الأطباء وتأخير الرعاية لمن يحتاجونها حقاً.
في نهاية المطاف، تؤكد هذه الدراسة تحدياً متزايداً في الطب الحديث. فبينما يتجه المزيد من الناس إلى الذكاء الاصطناعي للحصول على إرشادات صحية، تصبح الفجوة بين ما يمكن للتكنولوجيا القيام به وكيف يستخدمها الناس فعلياً قضية تتعلق بالسلامة. الكمبيوتر ليس معطلاً؛ هو ببساطة مدرب على فهم لغة الخبراء، لا لغة المرضى. وبالنسبة للملايين ممن يخوضون رحلة البحث عن تشخيص، يظل وعد هذه الأدوات غير مكتمل حتى تتمكن حقاً من الاستماع إلى الشخص الموجود في الغرفة، وليس فقط إلى السجل الطبي. ويتطلب المسار إلى الأمام بناء أنظمة يمكنها جسر هذا الانقسام، لضمان أنه عندما يصف المريض معاناته بكلماته الخاصة، لا تكون الإجابة التي يحصل عليها مجرد تخمين، بل دليلاً موثوقاً نحو الرعاية التي يحتاجها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.