Llettuce: An Open Source Natural Language Processing Tool for the Translation of Medical Terms into Uniform Clinical Encoding
تقدم هذه الورقة Llettuce، وهي أداة مفتوحة المصدر لمعالجة اللغات الطبيعية ومتوافقة مع اللائحة العامة لحماية البيانات (GDPR)، تستخدم النماذج اللغوية الكبيرة والمطابقة الضبابية لأتمتة وتحسين عملية ربط المصطلحات الطبية غير الرسمية بمفاهيم معيار OMOP، مما يعالج أوجه القصور في الحلول الحالية التي تعتمد بكثافة على العمل اليدوي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تنظيم مكتبة ضخمة وفوضوية، حيث لكل كتاب عنوان مختلف، مكتوب بلغة مختلفة، وبعض العناوين بها أخطاء إملائية، والبعض الآخر مكتوب بلهجة عامية. الآن، تخيل أنك بحاجة إلى فرز كل هذه الكتب في نظام فهرسة واحد مثالي ومعياري يستخدمه الأطباء والباحثون في جميع أنحاء العالم.
هذا هو بالضبط ما تحاول هذه الورقة البحثية حله، ولكن بدلاً من الكتب، نحن نتحدث عن المصطلحات الطبية.
إليك قصة Lettuce (الخس)، الأداة الجديدة المصممة لترتيب هذه الفوضى.
المشكلة: أزمة "الضياع في الترجمة"
في عالم الأبحاث الطبية، البيانات هي الذهب. ولكن لكي تكون البيانات مفيدة، يجب أن تكون FAIR (قابلة للإيجاد، والوصول، والتشغيل البيني، وإعادة الاستخدام). ولتحقيق ذلك، يستخدم الباحثون نظاماً معيارياً يسمى OMOP، وهو بمثابة قاموس عالمي للمفاهيم الطبية.
ومع ذلك، فإن البيانات الطبية في العالم الحقيقي فوضوية.
- قد يكتب مريض "Now Foods omega-3" في استبيان.
- قد يكتب طبيب "Tylenol" في ملاحظة.
- قد تكتب ممرضة "Motrin" أو حتى خطأً إملائياً مثل "Advilz".
القاموس العالمي (OMOP) لا يحتوي على "Now Foods omega-3"، بل يحتوي على "Fish Oil" (زيت السمك). ولا يحتوي على "Tylenol"، بل يحتوي على "Acetaminophen".
الطريقة القديمة:
في السابق، استخدم الباحثون أدوات مثل Athena (محرك بحث) أو Usagi (روبوت مطابقة).
- Athena تشبه استخدام فهرس بطاقات المكتبة الذي يبحث فقط عن الكلمات المطابقة تماماً. إذا بحثت عن "Fish Oil"، فسيجدها. أما إذا بحثت عن "Now Foods omega-3"، فسيصاب بالارتباك ويقترح "Calcium tablets by Now Foods" لأنه رأى كلمة "Now". إنه يفتقد إلى فهم "المعنى".
- Usagi أكثر ذكاءً قليلاً، لكنه يشبه مصحح الأخطاء الإملائية الذي ينظر فقط إلى كيفية كتابة الكلمات. إنه يعاني مع المصطلحات العامية، أو الأسماء التجارية، أو الأخطاء الإملائية. وغالباً ما يتطلب الأمر وجود إنسان يجلس هناك ويقوم بتصحيح الأخطاء يدوياً، وهو أمر بطيء وممل.
الحل: دخول "Lettuce"
قام المؤلفون ببناء Lettuce، وهي أداة مفتوحة المصدر تعمل مثل مترجم فائق الذكاء، ثنائي اللغة، يفهم ليس فقط الكلمات، بل الأفكان أيضاً.
تستخدم Lettuce ثلاث "قوى خارقة" (أو مسارات) رئيسية للعثين على المصطلح الطبي الصحيح:
1. المحقق بالكلمات المفتاحية (البحث النصي)
هذه هي الطريقة التقليدية القديمة. إنها تبحث عن كلمات تتطابق تماماً.
- التشبيه: إذا كنت تبحث عن "سيارة حمراء" (Red Car)، فهذه الأداة ستجد "سيارة حمراء". ولكن إذا قلت "سيدان قرمزي"، فقد تفشل في إيجادها. إنها سريعة، لكنها حرفية للغاية.
2. مطابقة المعنى (البحث الشعاعي/المتجهي)
هنا يحدث السحر. تستخدم Lettuce الذكاء الاصطناعي لفهم المفهوم الكامن وراء الكلمات. فهي تحول الكلمات إلى إحداثيات رياضية (متجهات).
- التشبيه: تخيل خريطة عملاقة حيث الكلمات هي مدن. "Paracetamol" و "Acetaminophen" هما اسمان مختلفان، ولكن على هذه الخريطة، يقعان في نفس الحي لأن معناهما واحد. حتى لو بدا "Fish Oil" و "Omega-3" مختلفين، فإن الذكاء الاصطناعي يعرف أنهما يسكنان في الجوار.
- هذا يسمح لـ Lettuce بأن تقول: "آه، 'Now Foods omega-3' هو في الواقع مجرد 'Fish Oil'!" رغم أن الكلمات لا تتطابق.
3. أمين المكتبة الحكيم (LLM + RAG)
أحياناً، لا تكفي الخريطة. هنا يأتي دور نماذج اللغات الكبيرة (LLMs). فكر في نموذج اللغة الكبير كأنه أمين مكتبة عبقري قرأ كل الكتب الطبية في العالم.
- الحيلة: أمين المكتبة لا يخمن فحسب؛ بل يستخدم تقنية RAG (التوليد المعزز بالاسترجاع). قبل أن يجيب أمين المكتبة، تقوم Lettuce بتسليمه حزمة تضم أفضل 10 مرشحين محتملين عثر عليهم "مطابق المعنى".
- التشبيه: بدلاً من سؤال أمين المكتبة "ما هذا؟" في فراغ، أنت تقول له: "إليك 10 احتمالات وجدتها. بناءً على هذه الاحتمالات، ما هي الإجابة الأفضل؟". يستخدم أمين المكتبة هذا السياق لتقديم إجابة أكثر ذكاءً ودقة.
لماذا Lettuce مميزة؟
- إنها خاصة: العديد من أدوات الذكاء الاصطناعي (مثل النسخة العامة من ChatGPT) ترسل بياناتك إلى السحابة. في الرعاية الصحية، بيانات المرضى حساسة (مثل مذكرات صحتك). تم تصميم Lettuce لتعمل محلياً على جهاز الكمبيوتر الخاص بك أو خادمك. إنها لا ترسل بيانات مرضاك أبداً إلى شركات التكنولوجيا الكبرى. إنها تحفظ الأسرار آمنة.
- إنها مفتوحة: هي أداة مجانية ومفتوحة المصدر، مما يعني أن أي شخص يمكنه الاطلاع على الكود، أو تحسينه، أو استخدامه دون دفع رسوم.
- إنها أذكى: في الاختبارات، وجدت Lettuce المصطلح الطبي الصحيح ضمن أفضل 10 اقتراحات بضعف عدد المرات التي وجدتها فيها الأدوات القديمة.
النتائج: اختبار من الواقع
اختبر الباحثون Lettuce على مجموعتين من البيانات:
- البيانات الرسمية: أدوية من تجربة مستشفى (حيث كانت الأسماء صحيحة غالسباً). أدت Lettuce أداءً جيداً، لكن الأدوات القديمة كانت جيدة هنا أيضاً.
- البيانات الفوضوية: استبيانات ذاتية التقرير من سنغافورة حيث كتب الناس أدويتهم بأسلوبهم الخاص (علامات تجارية، لغة عامية، أخطاء إملائية).
- الأدوات القديمة: عانت بشدة. لم تستطع فهم أن "Now Foods omega-3" هو "Fish Oil".
- Lettuce: نجحت ببراعة. من خلال الجمع بين "مطابق المعنى" و"أمين المكتبة الحكيم"، تمكنت من تحديد المصطلح الطبي المعياري بشكل صحيح في ما يقرب من 50% من الحالات الفوضوية (مقارنة بمعدلات أقل بكثير للأدوات الأخرى).
الخلاصة
Lettuce هي بمثابة مترجم عالي التقنية يسد الفجوة بين الطريقة التي يتحدث بها البشر عن صحتهم (فوضوية، غير رسمية، تعتمد على الأسماء التجارية) وبين الطريقة التي تحتاج بها الحواسيب لتخزين تلك البيانات (نظيفة، معيارية، ودقيقة).
إنها تجعل الأبحاث الطبية أسرع، وأكثر دقة، وأكثر أماناً لخصوصية المريض، مما يضمن أنه عندما يبحث العلماء عن البيانات، فإنهم لا يبحثون عن إبر في أكوام قش، بل يجدون الإجابات الصحيحة في مكتبة منظمة بشكل مثالي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.