Injecting Structured Biomedical Knowledge into Language Models: Continual Pretraining vs. GraphRAG
تقارن هذه الورقة بين استراتيجيتين لدمج المعرفة الطبية الحيوية المهيكلة من "UMLS Metathesaurus" في النماذج اللغوية —وهما التدريب المسبق المستمر وGraphRAG— حيث تُظهر أن التدريب المسبق يحقق مكاسب متواضعة في مهام محددة، بينما يوفر GraphRAG تحسينات فائقة وشفافة ولا تتطلب إعادة تدريب على الإجابة على الأسئلة الطبية الحيوية.
تخيل أنك تحاول تعليم طالب ذكي جداً لكنه صغير السن للغاية (نموذج لغوي) كيف يصبح طبيباً عالمياً. هذا الطالب ذكي، وقد قرأ الكثير من الكتب العامة، ويمكنه الكتابة بجمال. ولكن عندما تسأله أسئلة طبية محددة، فإنه أحياناً يخمن بشكل خاطئ، أو يختلق معلومات (يهلوس)، أو لا يعرف أحدث الأبحاث.
هذه الورقة البحثية تطرح سؤالاً بسيطاً: ما هي أفضل طريقة لمنح هذا الطالب المعرفة المحددة لموسوعة طبية (UMLS) لكي يصبح طبيباً أفضل؟
اختبر الباحثون طريقتين مختلفتين للتدريس:
الطريقة الأولى: "غرس الدماغ" (التدريب المسبق المستمر)
التشبيه: تخيل أنك تأخذ الطالب وتحبسه في مكتبة لبضعة أسابيع، ولا تطعمه سوى الكتب الطبية. أنت تجبره على حفظ كل حقيقة، وعلاقة، وتعريف حتى تصبح تلك المعرفة جزءاً من دماغه.
كيف تعمل: أخذ الباحثون قاعدة بيانات طبية ضخمة (UMLS) وحولوها إلى كومة هائلة من النصوص. ثم قاموا بـ "إعادة تدريب" نماذج الذكاء الاصطناعي (BERT و BioBERT) على هذا النص.
النتيجة:
بالنسبة للطالب العام (BERT): حقق هذا نتائج مذهلة. فقد انتقل الطالب من معرفة القليل عن الطب إلى كونه خبيراً راسخاً. لقد تعلم "لغة" الطب واستطاع الإجابة على الأسئلة المعقدة بشكل أفضل بك كثيراً.
بالنسبة للطالب المتخصص بالفعل (BioBERT): كان هذا الأمر صعباً بعض الشيء. فهذا الطالب قد قرأ بالفعل الملايين من الكتب الطبية. وإضافة المزيد من المعرفة المنظمة لم يساعد كثيراً، بل في بعض الحالات، تسبب في إرباكه قليلاً. الأمر يشبه محاولة تعليم طباخ ماهر وصفة جديدة بينما هو يعرف بالفعل 10,000 وصفة؛ أحياناً، المعلومات الجديدة تقف في الطريق فقط.
الططريقة الثانية: "امتحان الكتاب المفتوح" (GraphRAG)
التشبيه: بدلاً من إجبار الطالب على حفظ كل شيء، أنت تعطيه نظام بطاقات فهرسة سحري فائق السرعة (رسم بياني للمعرفة - Knowledge Graph) وعدسة مكبرة. عندما يتلقى سؤالاً، لا يعتمد على الذاكرة، بل يبحث بسرعة عن الإجابة في الفهرس، ويتتبع الروابط بين الحقائق، ثم يكتب الإجابة بناءً على ما وجده فقط.
كيف تعمل: بنى الباحثون خريطة رقمية ضخمة للحقائق الطبية باستخدام قاعدة بيانات تسمى Neo4j. عندما يتلقى الذكاء الاصطناعي (LLaMA) سؤالاً، فإنه لا يخمن. بل يبحث في هذه الخريطة، ويجد مسار الحقائق المحدد الذي يربط الإجابة، ثم يستخدم هذا المسار لتوليد استجابة.
النتيجة: كان هذا هو النجم الساطع في الدراسة.
لا حاجة للحفظ: لم يكن بحاجة لإعادة تدريب الذكاء الاصطناعي. كان يحتاج فقط للوصول إلى الخريطة.
دقة أفضل: أجاب على الأسئلة الطبية بدقة أكبر حتى من النماذج التي تعتمد على "الحفظ".
لا كذب: لأن على الذكاء الاصطناعي توضيح خطوات عمله (المسار في الخريطة)، فقد كان من الصعب جداً عليه اختلاق أي شيء.
سهولة التحديث: إذا تم اكتشاف طبي جديد، يمكنك ببساطة تحديث نظام البطاقات الفهرسية. لست بحاجة لإرسال الطالب للعودة إلى المدرسة لعدة أشهر.
الخلاصة الكبرى
تقارن الورقة البحثية بين الحفظ مقابل البحث.
الحفظ (الطريقة الأولى) رائع إذا كنت تبدأ بطالب لا يعرف شيئاً عن الموضوع. فهو يبني أساساً قوياً.
البحث (الطريقة الثانية) أفضل إذا كنت تريد إجابات أكثر دقة، وحداثة، وقابلية للتفسير. إنه يشبه امتلاك جهاز تحديد المواقع (GPS): لست بحاجة لحفظ خريطة المدينة بأكملها؛ أنت فقط بحاجة إلى جهاز يعرف أين أنت وإلى أين تذهب.
الاستنتاج: بالنسبة لنماذج الذكاء الاصطناعي العامة، فإن تعليمهم الحقائق (الطريقة الأولى) يعد بداية رائعة. ولكن بالنسبة للمهام الطبية الأكثر حرجاً حيث تهم الدقة والثقة أكثر من غيرها، فإن إعطاء الذكاء الاصطناعي "محرك بحث" للحقائق الطبية (الطريقة الثانية) هو الفائز. إنه أسرع، وأكثر صدقاً، وأسهل في المتابعة والتحديث.
لقد جعل الباحثون "نظام البطاقات الفهرسية" الخاص بهم (الرسم البياني للمعرفة) متاحاً للجميع لاستخدامه، حتى يتمكن العلماء الآخرون من تجربة هذه الطرق أيضاً!
إليك ملخص تقني مفصل للورقة البحثية بعنوان "حقن المعرفة الطبية الحيوية المهيكلة في النماذج اللغوية: التدريب المسبق المستمر مقابل GraphRAG".
1. بيان المشكلة
بينما حققت النماذج اللغوية الكبيرة (LLMs) والنماذج اللغوية المدربة مسبقاً (PLMs) نجاحاً كبيراً في معالجة اللغات الطبيعية (NLP)، إلا أنها تواجه قيوداً حرجة في المجالات كثيفة المعرفة مثل الطب الحيوي:
المعرفة الساكنة: تُدرب النماذج على لقطات ثابتة، مما يفتقر إلى المعرفة الواقعية المحدثة.
الهلوسة: غالباً ما تولد مخرجات واثقة ولكنها غير صحيحة.
الغموض: يصعب تتبع التنبؤات أو التحقق منها مقابل مصادر محددة.
الوصول غير المباشر للهياكل: تعتمد النماذج على النصوص غير المهيكلة، مما يجعل من الصعب الاستدلال صراحةً على العلاقات الدلالية المهيكلة (مثل الترادف، التصنيف الهرمي، والارتباطات متعددة الخطوات) الموجودة في الموارد المنسقة مثل UMLS Metathesaurus.
تعتمد النهج الحالية غالباً على مجموعات نصوص غير مهيكلة للتكيف مع المجال، أو تفتقر إلى مقارنة مباشرة بين تضمين المعرفة في معاملات النموذج (parameters) مقابل استرجاعها وقت الاستدلال.
2. المنهجية
يقترح المؤلفون ويقارنون بين استراتيجيتين متكاملتين لحقن المعرفة المهيكلة من UMLS-2024AA Metathesaurus في النماذج اللغوية. تستخدم كلتا الاستراتيجيتين نفس مصدر المعرفة الأساسي لضمان مقارنة عادلة.
أ. بناء مصدر المعرفة
المصدر: UMLS-2024AA Metathesaurus.
بناء الرسم البياني (Graph Construction): قام المؤلفون ببناء رسم بياني للمعرفة الطبية الحيوية واسع النطاق مخزن في Neo4j.
الحجم: 3.4 مليون مفهوم و34.2 مليون علاقة.
العملية: استخراج المفاهيم، التعريفات، الأنواع الدلالية، والعلاقات من جداول UMLS RRF. تم الفلترة للمدخلات الإنجليزية وإزالة العلاقات الذاتية.
التحويل للنص (Textualization): تحويل الرسم البياني إلى متن نصي مكون من 100 مليون توكن عن طريق توليد قطع من اللغة الطبيعية للثلاثيات (على سبيل المثال، "المفهوم أ يسبب المفهوم ب") وتجميع تعريفات المفاهيم، وأسمائها، وأنواعها الدلالية.
النهج: استئناف التدريب المسبق على متن UMLS النصي لدمج المعرفة مباشرة في أوزان النموذج.
النماذج:
BERTUMLS: التدريب المسبق المستمر لنموذج BERT العام.
BioBERTUMLS: التدريب المسبق المستمر لنموذج BioBERT المتخصص.
التدريب: هدف لغة مقنعة (Masked Language Modeling - MLM) لمدة دورة واحدة (1 epoch) على المتن النصي المكون من 100 مليون توكن.
ج. الاستراتيجية 2: الحقن غير البارامتري (GraphRAG)
النهج: إبقاء المعرفة خارجية في رسم Neo4j البياني واسترجاع الرسوم البيانية الفرعية ذات الصلة وقت الاستدلال.
خط الإنتاج (Pipeline):
الاسترجاع: يحفز استعلام المستخدم بحثاً عن التشابه الشعاعي (باستخدام model2vec) للعثور على المقاطع النصية ذات الصلة.
التنقل في الرسم البياني (Graph Traversal): تعمل هذه المقاطع كبذرة للتنقل في رسم Neo4j لاستخراج رسم بياني فرعي من الكيانات والعلاقات ذات الصلة.
التوليد: يتم تحويل الرسم البياني الفرعي إلى ثلاثيات نصية وحقنها في مطالبة (prompt) نموذج LLaMA 3-8B لتوليد الإجابة.
الميزة الرئيسية: لا يتطلب الأمر إعادة تدريب النموذج؛ حيث يمكن تحديث المعرفة عبر تجديد الرسم البياني.
3. المساهمات الرئيسية
مقارنة موحدة: دراسة مضبوطة تقارن بين الحقن البارامتري (التضمين) مقابل غير البارامتري (الاسترجاع) باستخدام نفس لقطة UMLS.
إتاحة الموارد: إصدار رسم بياني لـ UMLS في Neo4j معالج وواسع النطاق (3.4 مليون مفهوم، 34.2 مليون علاقة) والمتن النصي المكون من 100 مليون توكن لدعم قابلية التكرار.
رؤية منهجية: إثبات أن استراتيجية الحقن المثلى تعتمد على المعرفة بالمجال للنموذج الأساسي (عام مقابل متخصص).
تكييف GraphRAG: النجاح في تكييف GraphRAG مع المجال الطبي الحيوي، مما يسمح بالاستدلال متعدد الخطوات (multi-hop reasoning) وسلاسل أدلة قابلة للتفسير دون إعادة تدريب.
4. النتائج التجريبية
تم تقييم النماذج على ست مجموعات بيانات من BLURB تغطي خمسة أنواع من المهام (استخراج العلاقات، الأسئلة والأجوبة، تشابه الجمل، تصنيف المستندات، PICO).
أ. نتائج التدريب المسبق المستمر
المجال العام (BERT → BERTUMLS):
تحسينات ملحوظة عبر 5/6 مهام.
أكبر المكاسب: مهام الأسئلة والأجوبة كثيفة المعرفة (BioASQ بنسبة +7.6%، PubMedQA بنسبة +4.5%).
الاستنتاج: المعرفة المهيكلة المستهدفة ترفع فعلياً أداء النموذج العام إلى مستوى النماذج المتخصصة.
المجال المتخصص (BioBERT → BioBERTUMLS):
نتائج متباينة: أداء مختلط.
التحسينات: PubMedQA (+2.65%)، BIOSSES (+2.26%).
التراجعات: BioASQ (-5.19%)، DDI (-0.82%).
الاستنتاج: تحدث عوائد متناقصة عندما يكون النموذج الأساسي (BioBERT) مدرباً مسبقاً بالفعل على نصوص طبية حيوية ضخمة (~4.5 مليار كلمة). المتن الصغير لـ UMLS (100 مليون كلمة) يقدم فائدة هامشية محدودة ويمكن أن يؤدي أحياناً إلى إدخال الضجيج.
ب. نتائج GraphRAG
الأداء: أدى تعزيز LLaMA 3-8B باستخدام GraphRAG إلى مكاسب كبيرة دون أي إعادة تدريب:
PubMedQA: زيادة قدرها +6.25% في الدقة (51.2% → 54.4%).
BioASQ: زيادة قدرها +6.67% في الدقة (75.0% → 80.0%).
المقارنة: تفوق GraphRAG على كل من BERTUMLS و BioBERTUMLS في مهام الأسئلة والأجوبة.
في BioASQ، تفوق GraphRAG على BERTUMLS بنسبة 11.78% وعلى BioBERTUMLS بنسبة 5.86%.
الفوائد النوعية:
القابلية للتفسير: مسار استدلال النموذج قابل للفحص عبر الرسم البياني المسترجع.
الاستدلال متعدد الخطوات: نجح في ربط العلاقات (على سبيل المثال، ربط دواء بمرض عبر عقد أنطولوجية وسيطة) لتصحيح الهلوسات الأولية.
الحداثة: يمكن تحديث المعرفة فورياً عبر تجديد الرسم البياني، على عكس إعادة تدريب النموذج.
5. الأهمية والخاتمة
تضع الورقة تقسيماً عملياً للعمل في مجال معالجة اللغات الطبيعية الطبية الحيوية:
للنماذج العامة: استخدم التدريب المسبق المستمر على البيانات المهيكلة لإكسابها كفاءة المجال بكفاءة، مما يسد الفجوة مع النماذج المتخصصة.
للنماذج المتخصصة أو الاحتياجات الديناميكية: استخدم GraphRAG. فهو يتجنب العوائد المتناقصة لإعادة تدريب النماذج المتخصصة ويوفر مزايا حاسمة في القابلية للتفسير، الاستدلال متعدد الخطوات، وحداثة المعرفة.
تؤكد الدراسة أنه بينما يعد تضمين المعرفة مفيداً لبناء خط أساس قوي، فإن النهج القائم على الاسترجاع (GraphRAG) هو الأفضل للمهام التي تتطلب استدلالاً دقيقاً، وقابلاً للتحقق، ومحدثاً في المجالات سريعة التطور مثل الطب الحيوي. يطلق المؤلفون رسمهم البياني وخط إنتاجهم لتشجيع المزيد من الأبحاث في حقن المعرفة المهيكلة.