Curation and Extraction of Drug-Related Entities from Reddit Platform
تقدم هذه الورقة البحثية ReDose، وهو عبارة عن مجموعة بيانات تضم 6,435 منشورًا من منصة Reddit حول استخدام المواد المخدرة تم تصنيفها بمدخلات طبية من خبراء، وتقيم أداء نماذج ذكاء اصطناعي مختلفة في استخراج كيانات العقاقير والجرعات والآثار لسد الفجوة بين المعرفة السريرية وتجارب المستخدمين في العالم الحقيقي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل عالماً يتعلم فيه الأطباء عن العقاقر الخطيرة غالباً من خلال رؤية المرضى في غرف الطوارئ بعد وقوع الكوارث. هم يعرفون النتيجة (الجرعة الزائدة)، لكنهم غالباً ما يفتقدون إلى القصة حول كيفية استخدام الناس لهذه المواد في الواقع الحقيقي: الأسماء المستعارة، والجرعات الغريبة، والمشاعر المحددة التي يصفونها.
في هذه الأثناء، على وسائل التواصل الاجتماعي (وتحديداً موقع Reddit)، يشارك آلاف الأشخاص تجاربهم الخام وغير المفلترة. إنهم يتحدثون عما تناولوه، وكم الكمية، وكيف جعلهم ذلك يشعرون. لكن هذه المعلومات مدفونة في بحر فوضوي من النصوص، مكتوبة بلغة الشارع بدلاً من الكتب الطبية.
تقدم هذه الورقة مشروعاً يسمى REDOSE (REddit Drug DOSe and Effect - جرعة وتأثير عقاقر ريديت) لسد هذه الفجوة. فكر في الأمر كبناء "قاموس" متخصص و"مترجم" لتحويل الدردشة الفوضوية على الإنترنت إلى بيانات طبية مفيدة.
إليك تفصيل لما قاموا به، باستخدام تشبيهات بسيطة:
1. رحلة البحث عن الكنز (مجموعة البيانات)
ذهب الباحثون إلى سبعة "أحياء" محددة (subreddits) على Reddit مخصصة للمواد المخدرة مثل الفنتانيل، والهيروين، والمايكرودوزينج (الجرعات المتناهية الصغر). قاموا بجمع 6,435 منشوراً.
- التوسيم (الترميز): لجعل هذا الأمر مفهوماً، لم يكتفوا باستخدام الكمبيوتر فقط. بل استعانوا بـ طبيب سموم معتمد (خبير في العقاقر) لقراءة المنشورات وتحديد ثلاثة أشياء محددة، تماماً مثل معلم يصحح واجب طالب:
- العقار (DRUG): ما هي المادة المذكورة؟ (مثلاً: "fent"، "black tar"، "SEA #4").
- الجرعة (DOSE): كم الكمية التي تم تناولها؟ (مثلاً: "2 ملغ"، "قبضة صغيرة").
- التأثير (EFFECT): ماذا حدث للشخص؟ (مثلاً: "نشوة"، "لا أستطيع التنفس"، "شعور بالانتشاء").
كما طلبوا من اثنين من طلاب الطب مراجعة العمل للتأكد من الدقة. والنتيجة هي مجموعة بيانات ضخمة ونظيفة حيث كل ذكر للعقار، والجرعة، والتأثير، تم وسمه وجاهز لتعلم الحواسيب منه.
2. السباق: من يستطيع القراءة بشكل أفضل؟ (النماذج)
أراد الفريق معرفة ما إذا كان بإمكان الحواسيب تعلم إيجاد هذه الأشياء الثلاثة (العقار، الجرعة، التأمثير) تلقائياً. فقد نظموا سباقاً بين نوعين من "القراء" الاصطناعيين:
- المتخصصون (نماذج BERT): هؤلاء يشبهون أمين مكتبة متخصص. لقد تم تدريبهم خصيصاً على النصوص الطبية والعلمية. اختبر الباحثون عدة نسخ: BaseBERT، وBioBERT، وBiomedBERT.
- العباقرة العامون (نماذج LLMs): هؤلاء يشبهون الموسوعات ذات العقل (وتحديداً GPT-4 وLlama-3). هم يعرفون القليل عن كل شيء ويمكنهم الدردشة بشكل طبيعي. جرب الباحثون طريقتين لاستخدامهم:
- التعلم من محاولة واحدة (One-Shot): إعطاء الذكاء الاصطناعي مثالاً واحداً وطلب إكمال الباقي.
- الاسترجاع المعزز بالتوليد (RAG): إعطاء الذكاء الاصطناعي "ورقة غش" تحتوي على أمثلة مشابهة من بيانات التدريب قبل أن يجيب. هذا يشبه السماح للطالب بالنظر إلى بعض المسائل المحلولة قبل خوض الاختبار.
3. النتائج: من فاز؟
كانت للسباق بعض المنعطفات المفاجئة:
- إيجاد اسم العقار: كان المتخصصون (نماذج BERT) هم الأبطال هنا. كان BiomedBERT هو الأفضل في رصد أسماء العقاقير، حيث أصاب بنسبة تقارب 84%. ومن المثير للاهتمام أن "العباقرة العامين" (LLMs) كانوا جيدين، لكنهم لم يكونوا بحدة المتخصصين في هذه المهمة تحديداً.
- إيجاد التأثير: كان هذا هو الجزء الأصعب. الأمر يشبه محاولة إيجاد شعور محدد في قصيدة. حتى أفضل ذكاء اصطناعي واجه صعوبة هنا. كان GPT-4 هو الأفضل في إيجاد "التأثيرات"، لكنه لا يزال يخطئ في أكثر من نصفها (الاستدعاء/Recall بلغ 0.41). أما المتخصصون فكانوا أسوأ حالاً، حيث كانوا يخطئون في إيجاد التأثيرات تماماً في كثير من الأحيان.
- "ورقة الغش" (RAG): عندما أعطوا ذكاء Llama-3 الاصطناعي "ورقة غش" تحتوي على أمثلة مشابهة (RAG)، أصبح أفضل بكثير في إيجاد أسماء العقاقير، حيث قفز من نسبة نجاح 44% إلى أكثر من 80%. ومع ذلك، لم تساعد هذه الحيلة كثيراً في إيجاد "التأثيرات".
4. لماذا كان الأمر صعباً؟
توضح الورقة عدداً من الأسباب التي جعلت الذكاء الاصطناعي يعاني، خاصة فيما يتعلق بـ "التأثيرات":
- اللغة العامية مقابل العلم: يستخدم الناس على Reddit لغة غريبة، ومبتكرة، وغير متسقة. قد يقول شخص ما "أشعر أنني رائع"، بينما يقول آخر "أنا فوق السحاب". يصاب الذكاء الاصطناعي بالارتباك بسبب هذه الاختلافات.
- قاعدة "المطابقة التامة": كان الباحثون صارمين جداً. إذا خمن الذكاء الاصطناعي الشعور الصحيح ولكنه أخطأ في كلمة واحدة (مثلاً، خمن "depress" بدلاً من "depress your respiration")، فإن ذلك يُحتسب كإجابة خاطئة. هذا جعل النتائج تبدو أقل مما قد تكون عليه في سيناريو واقعي.
- السياق: أحياناً يتم وصف التأثير بطريقة تتطلب فهم الجملة بأكملة، وليس فقط الكلمات الموجودة بجانب العقار مباشرة.
الخلا الخلاصة
تخلص الورقة إلى أن REDOSE هو أداة فريدة وقيمة لأنه يلتقط "لغة الشارع" المتعلقة باستخدام العقاقير التي يفتقدها الأطباء عادةً.
بينما تعتبر "العباقرة العامون" (LLMs) قوية وسهلة الاستخدام، إلا أن "المكتبات المتخصصة" (نماذج BERT التي تم ضبطها بدقة) كانت في الواقع أفضل في المهمة المحددة المتمثلة في إيجاد أسماء العقاقر في هذه البيئة الفوضوية المليئة باللغة العامية. ومع ذلك، فإن إيجاد "التأثيرات" يظل تحدياً صعباً لجميع الحواسيب، مما يشير إلى أننا بحاجة إلى طرق أكثر ذكاءً لتعليم الذكاء الاصطناعي كيفية فهم المشاعر البشرية والأوصاف.
باخت اختصار، لقد بنوا مكتبة ضخمة، مصنفة بخبرة، لقصص العقاقير على Reddit، وأثبتوا أنه بينما يجيد الذكاء الاصطناعي القراءة، فإنه لا يزال بحاجة إلى مساعدة لفهم الطريقة الفوضوية، والعاطفية، والممتلئة باللغة العامية التي يتحدث بها الناس عن تجاربهم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.