Hybrid lexical-semantic retrieval over SNOMED CT: combining two retrieval paradigms to facilitate clinical data entry
تُثبت هذه الورقة أن بنية استرجاع هجينة تجمع بين المطابقة المعجمية الحتمية والبحث الدلالي المتعلم، وتطبيع الاستعلام، ودمج الترتيب، يمكن أن تُمكّن هذين النموذجين من التعايش بأمان عبر نظام SNOMED CT دون مقايضات، مما يؤدي إلى تحسين دقة إدخال البيانات السريرية لكل من المصطلحات الدقيقة والمدخلات الغامضة والمختصرة، مع تقليل الحاجة إلى تنسيق المفردات المحلية الذي يتطلب جهداً مكثفاً.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل
في السجلات الرقمية للمستشات الحديثة، تُترجم كل أعراض وتشخيص وإجراء طبي إلى رمز عالمي. هذا النظام، المعروف باسم SNOMED CT، يعمل كقاموس ضخم ومنظم بدقة للطب، مما يضمن أن الطبيب في بلد ما والباحث في بلد آخر يتحدثان اللغة نفسها عند مناقشة مرض معين. ومع ذلك، فإن الأشخاص الذين يستخدمون هذا النظام يوميًا — الأطباء والممرضين وغيرهم من الممارسين السريريين — لا يتحدثون بتعريفات القاموس المثالية؛ فهم يكتبون شذرات، واختصارات، ورموزًا موجزة، وغالبًا ما يمزجون بين اللغات أو يصفون حالات بطرق تبدو طبيعية بالنسبة لهم ولكنها لا تشبه المصطلحات الرسمية بتاتًا. لطال oldًا ما كان التحدي يكمن في كيفية جسر هذه الفجوة: كيف يمكن للمستخدم كتابة ملاحظة سريعة وغير منظمة مثل "heart attack" (نوبة قلبية) أو "inf myo" (احتشاء عضلة القلب) ليجد الكمبيوتر فورًا المفهوم الطبي الرسمي الدقيق، دون إجبار المستخدم على تعلم المفردات الدقيقة أو بناء قائمة مخصصة منفصلة لكل طريقة محتملة قد يصف بها الطبيب حالة ما.
اقترح فريق من الباحثين من منظمة SNOMED International طريقة جديدة لحل هذه المشكلة من خلال دمج طريقتين مختلفتين تمامًا للبحث في تجربة واحدة سلسة. فبدلاً من الاختيار بين بحث صارم يعتمد على مطابقة الحروف حرفًا بحرف، أو بحث مرن يعتمد على المعنى، بنوا نظامًا يستخدم كليهما في وقت واحد. يوضح عملهم أن هاتين التقنيتين المتعارضتين يمكن أن تعملا معًا دون أن تعيق إحداهما الأخرى. وفي اختباراتهم، نجح النظام في مطابقة الملاحظات الطبية الواقعية غير المنظمة مع الرموز الرسمية الصحيحة بنسبة 60% تقريبًا من المحاولة الأولى، ووضع الإجابة الصحيحة ضمن أفضل عشر خيارات في 80% من الحالات. والأهم من ذلك، وجدوا أن إضافة البحث المرن القائم على المعنى لم تفسد دقة البحث الصارم القائم على الحروف؛ بل إن الطريقتين غطتا نقاط الضعف لدى بعضهما البعض، مما خلق أداة أكثر قوة لإدخال البيانات السريرية.
يكمن جوهر المشكلة في عدم التطابق بين الكلام البشري ومنطق الكمبيوتر. فعندما يكتب الطبيب استعلامًا، قد يدخل عبارة كاملة، أو جزءًا من كلمة، أو اختصارًا غامضًا. محرك البحث التقليدي الذي يبحث عن تطابقات حرفية دقيقة يكون سريعًا ودقيقًا ولكنه يفشل تمامًا إذا كان إملاء المستخدم غير دقيق أو إذا استخدم لغة مختلفة. ومن ناحية أخرى، يمكن لأدوات الذكاء الاصطناعي الحديثة فهم المعنى وراء الكلمات، حيث تدرك أن "water on the knee" (ماء على الركبة) تشير إلى حالة طبية محددة حتى لو لم تشترك الكلمات في أي حروف مع المصطلح الرسمي. ومع ذلك، غالبًا ما تواجه هذه الأدوات القائمة على المعنى صعوبة في التعامل مع الشذرات القصيرة أو الاختصارات، ويمكن أن ترتبك أحيانًا بسبب التنوع الهائل في التعبير البشري. لسنوات، كان الحل لهذا المأزق هو توظيف خبراء لإنشاء قوائم طويلة يدويًا لكل طريقة محتملة قد يصف بها الطبيب حالة ما، وهي عملية بطيئة ومكلفة ويصعب مواكبتها مع تطور المعرفة الطبية.
تساءل الباحثون عما إذا كان من الممكن تجاوز عملية صنع القوائم اليدوية وترك الكمبيوتر يكتشف الرابط تلقائيًا باستخدام نهج هجين. لقد بنوا نموذجًا أوليًا لنظام يعمل بمحركي بحث في آن واحد. البحث الأول هو محرك حتمي صارم يبحث عن الحروف المحددة التي كتبها المستخدم، بغض النظر عن ترتيبها. فإذا كتب الطبيب "myo inf"، فإن هذا المحرك يعرف أنه يجب البحث عن كلمات تبدأ بتلك الحروف، مثل "myocardial infarction". وفي الوقت نفسه، يبحث محرك ثانٍ "متعلم" في المعنى العام للمدخلات، مستخدمًا قاعدة بيانات واسعة من المفاهيم الطبية لإيجاد المطابقات بناءً على التشابه بدلاً من مجرد الإملاء. ثم يقوم النظام بدمج النتائج من كلا البحثين. ولضمان ألا يطغى البحث الأضعف لاستعلام معين على البحث الأقوى، تقوم خطوة نهائية بإعادة تقييم القائمة المدمجة، مما يرفع الإجابة الأكثر صلة إلى الأعلى ويدفع المطابقات غير ذات الصلة إلى الأسفل.
لاختبار ما إذا كانت هذه الفكرة ناجحة في العالم الحقيقي، قيم الفريق نظامهم باستخدام مجموعتين مختلفتين من البيانات. الأولى كانت مجموعة من تقارير الحالات الطبية باللغة الإسبانية، حيث كان الهدف هو معرفة ما إذا كان بإمكان النظام أخذ اسم مرض باللغة الإسبانية وإيجاد الرمز الطبي الإنجليزي الصحيح. والثانية كانت مجموعة ضخمة من السجلات الصحية الإلكترونية الحقيقية من الولايات المتحدة، تحتوي على آلاف ملخصات الخروج التي كتبها أطباء باللغة الإنجليزية. كانت هذه السجلات غير منظمة، ومليئة بالاختصارات والرموز الشائعة في الممارسة اليومية ولكن يصعب على الكمبيوتر تفسيرها. وقاس الباحثون عدد المرات التي تمكن فيها النظام من وضع الرمز الطبي الصحيح في أعلى القائمة، أو على الأقل ضمن أول عشر خيارات يراها المستخدم على شاشته.
أظهرت النت النتائج أن النهج الهجين كان فعالاً للغاية. في مجموعة الاختبار الإسبانية، وجد النظام الرمز الصحيح تمامًا كأول نتيجة في 60% من ذكر الأمراض. وعند النظر في أفضل عشر نتائج، كان الرمز الصحيح موجودًا في 80% من الحالات. تم تحقيق هذا الأداء دون أي تدريب يدوي على المصطلحات الإسبانية المحددة؛ فقد استخدم النظام ببساة فهمه للمفاهيم الطبية لسد الفجوة اللغوية. واكتشف الباحثون أيضًا أن طريقتي البحث كانت بالفعل متكاملتين. فقد برع محرك مطابقة الحروف الصارم في التعامل مع المدخلات القصيرة والمجزأة مثل الاختصارات، بينما كان المحرك القائم على المعنى أفضل في التعامل مع العبارات الكاملة واللغات المختلفة. وعند دمجهما، كان النظام أقوى من أي من الطريقتين بمفردهما، ولم يؤدِ وجود الطريقة الثانية إلى تراجع أداء الطريقة الأولى.
كان أحد الاكتشافات الرئيسية هو أن النظام لم يكن بحاجة لمعرفة أي نوع من البحث سيكون الأفضل لاستعلام معين مسبقًا. في الماضي، ربما حاول المطورون تخمين ما إذا كان المستخدم يكتب جملة كاملة أو بضعة حروف وتوجيه البحث وفقًا لذلك. أما هذا النظام الجديد فيقوم ببساطة بتشغيل المسارين ويترك خطوة إعادة الترتيب النهائية تقرر الإجابة الأفضل. هذا التصميم يجعل النظام قويًا ضد الطبيعة غير المتوقعة للكتابة البشرية. ومع ذلك، لاحظ الباحثون أيضًا أن النظام ليس مثاليًا؛ فقد واجه صعوبة مع الاختصارات الكثيفة والمبهمة التي تعتمد بشدة على السياق، مثل سلسلة من الحروف التي قد تعني أشياء مختلفة اعتمادًا على النص المحيط. في هذه الحالات الصعبة، احتاج النظام أحيانًا إلى نظرة ثانية، باستخدام النص المحيط بالملاحظة الطبية لتوضيح المعنى، مما حسن معدل نجاحه بشكل كبير لتلك الاستعلامات الصعبة تحديدًا.
كما سلطت الدراسة الضوء على تحول في كيفية صيانة أنظمة المصطلحات الطبية في المستقبل. حاليًا، تنفق المستشفيات موارد كبيرة لإنشاء وتحديث قوائمها المخصصة من المصطلحات لمساعدة الأطباء في العثات على الرموز الصحيحة. يقترح الباحثون أن طريقة البحث الهجينة هذه يمكن أن تقلل من الحاجة إلى مثل هذه القوائم اليدوية المكثفة. ومن خلال الاعتماد على القاموس الطبي الرسمي وترك الكمبيوتر يتعامل مع تنوع اللغة والإملاء، يمكن للمستشفيات تركيز جهودها على حوكمة النظام والتحقق من النتائج بدلاً من التأليف اليدوي لآلاف المترادفات. هذا لا يلغي الحاجة إلى الصيانة، ولكنه يغير طبيعة العمل من كتابة مصطلحات جديدة إلى إدارة الأدوات التي تجدها.
كان الباحثون حذرين في الإشارة إلى أن نتائجهم تستند إلى تكوين محدد للبرامج والنماذج، وأن النظام ليس جاهزًا بعد للاستخدام في بيئة مستشفى حية دون مزيد من الاختبارات. وأكدوا أنه بينما كان النظام يعمل بشكل جيد في بيانات الاختبار، فإن الاستخدام السريري في العالم الحقيقي ينطوي على مخاطر أعلى وسيناريوهات أكثر تعقيدًا. وتعتبر الدراسة بمثابة إثبات لمفهوم، يوضح أنه من الممكن تقنيًا دمج هاتين التقنيتين المتعارضتين في سير عمل واحد آمن وفعال. إنها تقدم مسارًا مستقبليًا حيث يمكن لـ دقة إدخال البيانات الصارمة ومرونة اللغة البشرية أن يتعايشا، مما قد يسهل على الممارسين السريريين تسجيل معلومات المرضى بدقة دون أن يثقل كاهلهم المتطلبات الجامدة لنظام الكمبيوتر.
في النهاية، يشير العمل إلى أن مستقبل إدخال البيانات السريرية قد لا يتطلب من الأطباء تغيير طريقة حديثهم أو كتابتهم، ولا يتطلب من المستشفيات بناء قواميس مخصصة ضخمة. بدلاً من ذلك، يشير الأمر نحو نظام يفهم الحروف المكتوبة بدقة والهدف الكامن وراءها، ويدمج هذين المنظورين للعثور على الإجابة الصحيحة. ومن خلال إثبات أن هاتين الطريقتين المختلفتين للبحث يمكن أن تعملا معًا دون أن تلغيا بعضهما البعض، فتح الباحثون الباب أمام طرق أكثر سهولة وكفاءة لربط المعرفة الطبية البشرية بالبيانات المهيكلة التي تدعم الرعاية الصحية الحديثة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.