Evaluation of Elicit as an adjunct search, screening, and data extraction tool for systematic reviews
تقيم هذه الدراسة أداة "Elicit" كأداة ذكاء اصطناعي للمراجعات المنهجية، حيث وجدت أنه بينما توفر وفراً كبيراً في الوقت وقدرات مفيدة في استخراج البيانات، فإن ضعف تداخل البحث وانخفاض دقة الفرز يشيران إلى أنها مناسبة حالياً فقط كأداة مساعدة وليست بديلاً مستقلاً لعملية المراجعة المنهجية.
المؤلفون الأصليون:Wei, I., Shah, J. N., Miah, A., Hawco, C., Coutts, F., Sikstrom, L., Ameis, S. H., Voineskos, A. N., Glatard, T., Dickie, E. W.
في عالم الأبحاث الطبية، تبرز المراجعة المنهجية كحجر الزاوية للحقيقة. إنها عملية صارمة يقوم فيها العلماء بجمع كل الدراسات المتاحة حول سؤال محدد، وفحصها بعناية فائقة، ودمج نتائجها لتحديد ما هو معروف فعلياً عن قضية صحية ما. هذا المنهج ضروري للأطباء عند اتخاذ قرارات العلاج ولصناع السياسات عند وضع الإرشادات الصحية، ومع ذلك، فهو عملية صعبة للغاية؛ إذ تتسم بالبطء والتكلفة العالية وتتطلب جهداً بشرياً هائلاً، وغالباً ما تستغرق سنوات لإتمامها، حيث تقضي فرق الباحثين وقتاً في قراءة آلاف العناوين والملخصات لتقرير أي الأوراق البحثية تنتمي إلى التحليل النهائي. ومع نمو حجم العلوم المنشورة كل يوم، أصبحت مهمة مواكبة الأدبيات الجديدة عبئاً ساحقاً، مما دفع الكثيرين للتساؤل عما إذا كان الذكاء الاصطعي بإمكانه تحمل هذا العبء الثقيل.
تستكشف دراسة حديثة من فريق في مركز الإدمان والصحة العقلية في تورونتو هذا الاحتمال تحديداً عبر اختبار أداة ذكاء اصطناعي معينة تسمى "إليسيت" (Elicit). أراد الباحثون معرفة ما إذا كان هذا البرنامج يمكنه محاكاة عمل فريق بشري يجري مراجعة منهجية. ولمعرفة ذلك، أخذوا مراجعة سبق لمجموعتهم إنجازها يدوياً — وهي دراسة تبحث فيما إذا كانت أعراض الذهان المبكرة والخفيفة لدى الشباب تتنبأ بتشخيصات الصحة العقلية اللاحقة — وطلبوا من "إليسيت" القيام بنفس المهمة تماماً. لقد قارنوا نتائج الذكاء الاصطناعي بعمل الفريق البشري في كل مرحلة، بدءاً من البحث الأولي عن الأوراق وصولاً إلى الاستخراج النهائي للبيانات، حيث قاسوا عدد الدراسات الصحيحة التي وجدها الذكاء الاصطناعي، وكم عدد الدراسات التي أغفلها، ومقدار الوقت الذي وفره.
كشفت النتوة عن أداة قوية ولكنها ليست جاهزة بعد للعمل بمفردها. فعندما تعلق الأمر بالبحث الأولي، واجه "إليسيت" صعوبة كبيرة؛ فبينما وجد الفريق البشري أكثر من 5,000 دراسة ذات صلة باستخدام طرق البحث التقليدية، لم يكشف محرك بحث "إليسيت" سوى 158 دراسة من تلك الدراسات نفسها. وهذا يعني أن الذكاء الاصطناعي قد أغفل الغالبية العظمى من الأبحاث التي حددها البشر، مما يشير إلى أن قدرات البحث الحالية لديه ليست واسعة بما يكفي لاستبدال عمليات البحث الدقيقة والمنظمة التي يقوم بها الباحثون البشر. ومع ذلك، بمجرد وضع الدراسات أمامه، أظهر الذكاء الاصطناعي بعض الوعود؛ فخلال عملية الفرز، حيث يقرر الباحثون ما إذا كانت الورقة البحثية ذات صلة كافية لقراءتها بالكامل، كان أداء "إليسيت" متوسطاً. فقد نجح في تحديد معظم الدراسات الهامة، لكنه ارتكب نوعاً معيناً من الأخطاء: فقد مال إلى تضمين أوراق كان ينبغي استبعادها، حيث كان مفرطاً في الحذر، فسمح بدخول ملصقات المؤتمرات والملخصات التي لم تكن مقالات بحثية كاملة، كما أخطأ أحياناً في تقدير ما إذا كانت الدراسة تحتوي على بيانات التشخيص الطبي الصحيحة.
ظهرت النتائج الأكثر تشجيعاً في مرحلة استخراج البيانات، حيث حاول الذكاء الاصطناعي استخراج أرقام وحقائق محددة من الأوراق المختارة. أثبت "إليسيت" أنه مساعد مفيد، حيث نجح في إيجاد تطابقات دقيقة للتفاصيل الأساسية مثل اسم المؤلف، وسنة النشر، وبلد الدراسة في جميع الحالات تقريباً. وحتى عندما لم يجد الرقم المثالي، فإنه غالباً ما كان يقدم جملة من النص الأصلي ترشد القارئ البشري إلى المعلومة الصحيحة، وهو ما يعد موفراً كبيراً للوقت. أما بالنسبة للتفاصيل الأكثر تعقيداً، مثل العمر الدقيق للمشاركين أو النتائج الإحصائية المحددة، فقد كان الذكاء الاصطناعي أقل دقة، حيث كان يسحب أحياناً بيانات من المجموعة الخطأ داخل الدراسة أو يغفل القيمة المحددة المطلوبة لحساب نهائي. ورغم هذه العيوب، كان الفرق في السرعة مذهلاً؛ فقد استغرق الفريق البشري ما يقرب من 445 ساعة من العمل لإتمام عملية المراجعة بأكملها، مع مشاركة عدة باحثين للتدقيق في كل خطوة، بينما أكمل الذكاء الاصطناعي نسخته من المهمة نفسها في ثلاث ساعات فقط.
في النهاية، خلصت الدراسة إلى أن "إليسيت" شريك قيم ولكنه ليس بديلاً. فهو ليس قادراً بعد على إجراء مراجعة منهجية بمفرده لأنه يفتقد الكثير من الدراسات في مرحلة البحث، ويرتكب الكثير من الأخطاء في مرحلة الفرز لدرجة لا تسمح بالوثوق به دون إشراف. ومع ذلك، فإن قدرته على مسح المستندات بسرعة والإشارة إلى جمل محددة تجعل منه أداة ممتازة لتسريع عمل الباحثين البشر. ويقترح المؤلفون أن النهج الأفضل هو استخدام الذكاء الاصطناعي كمراجع ثانٍ أو ثالث، بحيث يتولى القيام بالمهام الشاقة المتمثلة في إيجاد المعلومات، بينما يشرف خبير بشري على العملية لضبط الأخطاء وضمان دقة النتائج النهائية. وبهذه الطريقة، يمكن لهذه التكنولوجيا تقليل الوقت والتكلفة في البحث دون التضحية بالموثوقية التي يتطلبها العلم الطبي.
ملخص تقني: تقييم أداة Elicit كأداة مساعدة للبحث، والفرز، واستخراج البيانات في المراجعات المنهجية
بيان المشكلة تُعد المراجعات المنهجية حجر الزاوية في الطب القائم على الأدلة والسياسات، لكنها معروفة بكونها كثيفة العمالة، ومكلفة، وعرضة للخطأ البشري، وغالبًا ما تتطلب أكثر من 67 أسبوعًا لإكمالها. وقد أصبح حجم الأدبيات المنشورة هائلًا، مما دفع الباحثين إلى استكشاف الذكاء الاصطناعي (AI) لدعم عملية المراجعة. وبينما تدعي أدوات الذكاء الاصطناعي مثل Elicit.org أنها تحاكي سير عمل المراجعة المنهجية باستخدام التشابه الدلالي والنماذج اللغوية الكبيرة، لا تزال المخاوف قائمة بشأن دقتها، وموثوقيتها، واحتمالية إدخال التحيز. وقد أظهرت التقييمات السابقة نتائج متباينة، حيث أشارت بعض الدراسات إلى انخفاض الحساسية في عملية الفرز وحالات من "التلفيق" (confabulation) في استخراج البيانات. وهناك نقص في الأدلة المراجعة من قبل الأقران التي تفصل صراحةً أداء Elicit عبر جميع مراحل المراجعة المنهجية عند مقارنتها بمعيار يدوي صارم، لا سيما في سياقات أبحاث الصحة العقلية المعقدة التي تتضمن مقاييس غير متجانسة مثل أعراض طيف الذهان (PSS).
المنهجية قام المؤلفون بإجراء تقييم مقارن من خلال محاولة إعادة إنتاج مراجعة وتحليل تلوّي (meta-analysis) يدوي تم إنجازه مؤخرًا (Shah et al.) باستخدام Elicit. بحثت المراجعة اليدوية فيما إذا كانت أعراض طيف الذهان لدى الشباب تتنبأ بتشخيصات الصحة العقلية اللاحقة، مع الالتزام بإرشادات PRISMA واستخدام منصة Covidence.
المعيار اليدوي: قام فريق مكون من 4 إلى 5 مراجعين بإجراء فرز مزدوج للعناوين/الملخصات والنصوص الكاملة، متبوعًا باستخراج البيانات. أسفر البحث عن 5,285 دراسة، نتج عنها 41 دراسة مدرجة في التحليل التلوي النهائي.
بروتوكول Elicit: استخدم مستخدم واحد اشتراكًا من الفئة الاحترافية (Pro-tier) في Elicit لإعادة إنتاج العملية. تم إدخال سؤال البحث مباشرة في البحث الدلالي الخاص بـ Elicit. ولضمان قابلية المقارنة، تم تعزيز نتائج بحث Elicic الأولية (المحدودة بـ 1,000 دراسة) بـ 233 دراسة التي وصلت إلى مرحلة فحص النص الكامل في المراجعة اليدوية (باستثناء المكررات).
تكوين الفرز: تم ضبط عتبة الفرز في Elicit على القيمة الافتراضية 2.5/5. وتم تفعيل ميزات "المعايير الصارمة" لأربعة قواعد محددة للشمول والاستبعاد: النتائج التشخيصية، مدة المتابعة (> سنة واحدة)، تصميم الدراسة (استبعاد المراجعات/الملصقات)، وتاريخ النشر.
استخراج البيانات: تمت مقارنة نتائج الاستخراج في Elicit مقابل الاستخراج اليدوي لـ 34 من أصل 41 دراسة مدرجة. تم تسجيل المطابقات على مقياس من 0 (غير دقيق) إلى 2 (مطابقة تامة)، مع التركيز بشكل خاص على ما إذا كانت الأداة توفر استشهادات "مفيدة" محددة للجمل حتى في حالة عدم وجود مطابقة تامة.
المقاييس: حسبت الدراسة الدقة، والضبط، والحساسية، ومعدلات الخطأ، وتوفير وقت الأشخاص في مراحل البحث، والفرز، والاستخراج.
النتائج الرئيسية
أداء البحث: أظهر البحث الدلالي لـ Elicit تداخلًا ضعيفًا مع استراتيجية البحث اليدوية. فقد حدد 158 دراسة فقط من أصل 5,285 دراسة وُجدت يدويًا (تداخل بنسبة 15.8%)، مما نتج عنه دقة قدرها 0.158. ومن الجدير بالذكر أن 66% من الدراسات المدرجة في التحليل التلوي اليدوي النهائي لم يتم استرجاعها بواسطة وظيفة البحث في Elicit.
أداء الفرز:
فرز الملخصات: أظهر Elicit دقة متوسطة (0.63) وحساسية (0.71) ولكن ضبطًا ضعيفًا (0.68)، مع ميل نحو الإيجابيات الكاذبة.
فرز النص الكامل: ظلت الدقة متوسطة (0.74) مع حساسية بلغت 0.78، لكن الضبط انخفض بشكل كبير إلى 0.38.
تحليل الخطأ: أظهرت الأداة انحيازًا نحو الإيجابيات الكاذبة، حيث أدرجت خطأً ملخصات مؤتمرات، وملصقات، ودراسات ذات نتائج تشخيصية غير صحيحة (مثل استخدام "تدهور الأعراض" بدلاً من "التشخيص الرسمي"). وعلى العكس من ذلك، حدثت سلبيات كاذبة عندما فشل Elicit في تحديد النتائج التشخيصية الصالحة أو استبعد دراسات بسبب انخفاض درجاتها عن العتبة رغم استيفائها للمعايير.
استخراج البيانات:
الدقة: بالنسبة للبيانات الوصفية البسيطة (المؤلف، السنة، البلد)، حقق Elicit معدلات مطابقة تامة عالية (91–97%).
البيانات الدقيقة: انخفض الأداء بالنسبة للمتغيرات المعقدة. حقق "متوسط العمر" معدل مطابقة تامة بنسبة 61%، بينما سجلت "التأثير" (القيم الإحصائية للتحليل التلوي) أدنى معدل بنسبة 65%.
الفائدة: حتى عند عدم العثين على مطابقة تامة، قدمت الأداة معلومات "مفيدة" (مثل نطاقات العمر بدلًا من المتوسطات، أو استشهادات محددة للجمل) في 85% من الحالات عبر جميع المعايير.
كفاءة الوقت: كانت النتيجة الأكثر أهمية هي تقليل وقت الأشخاص. تطلبت المراجعة اليدوية 444.97 ساعة (بمشاركة مراجعين متعددين)، بينما استغرقت العملية بمساعدة Elicit 3.16 ساعة فقط.
المساهمات الرئيسية تقدم هذه الدراسة مقارنة تفصيلية مرحلة بمرحلة بين Elicim وبين مراجعة منهجية يقودها البشر في مجال نفسي معقد. وهي تحدد كميًا المقايضات بين الكفاءة والدقة، موضحة أنه بينما يقلل Elicit من استثمار الوقت بشكل كبير، فإنه يفتقر حاليًا إلى شمولية استدعاء البحث ودقة الفرز المطلوبة للاستخدام المستقل. تسلط الورقة الضوء على أوجه الفشل المحددة، مثل عدم القدرة على التمييز بين تدهور الأعراض والتشخيص الرسمي، والصعوبة في استخراج تأثيرات إحصائية محددة من الأوراق التي تحتوي على تحليلات فرعية متعددة.
الأهمية والادعاءات يخلص المؤلفون إلى أن Elicit واعد كأداة مساعدة ولكنه ليس جاهزًا كبديل مستقل لعملية المراجعة المنهجية.
البحث: يشير التداخل المنخفض في نتائج البحث إلى أن Elicit لا يمكنه حاليًا استبدال عمليات البحث في قواعد البيانات التقليدية (مثل Ovid Medline، PsycINFO) لتحديد الأدبيات الشاملة.
الفرز: يشير معدل الإيجابيات الكاذبة المرتفع والحساسية المتوسطة إلى أن Elicit يمكن أن يعمل كـ "مراجع ثانٍ" للإمساك بالدراسات المحتملة للإدراج، ولكن الاعتماد عليه وحده ينطوي على مخاطر استبعاد الدراسات ذات الصلة (سلبيات كاذبة) أو إدراج درسات غير ذات صلة (إيجابيات كاذبة).
الاستخراج: تجعل قدرة الأداة على تقديم استشهادات محددة للجمل من Elicit وسيلة مساعدة فعالة للكفاءة في استخراج البيانات، مما يسمح لمراجع بشري واحد بالإشراف على العملية بدلاً من الحاجة إلى فرز مزدوج. ومع ذلك، تظل الرقابة البشرية ضرورية لنقاط البيانات الدقيقة مثل أحجام التأثير ومدد المتابعة.
تدعو الورقة إلى سير عمل هجين حيث يعمل Elicit كمراجع ثانٍ أو ثالث لتسريع العملية، مع حل النزاعات من خلال الفصل البشري، بدلاً من محاولة أتمتة المراجعة بالكامل.