← أحدث الأبحاث
📄 medicine

GPT-4o and DeepSeek-V3 responses to common migraine questions: a cross-sectional comparative study of accuracy, completeness, empathy, readability and safety

وجدت هذه الدراسة المقطعية المقارنة أنه بينما قدم كل من GPT-4o وDeepSeek-V3 معلومات دقيقة وآمنة بشكل عام حول الصداع النصفي، فقد أظهر DeepSeek-V3 درجات أعلى بكثير في الاكتمال وسهولة القراءة، رغم أن أيًا من النموذجين لم يكن متفوقًا بشكل موحد في التعاطف أو السلامة.

المؤلفون الأصليون: Ahmet Burak Elbeyli, Hasan Hüseyin Kır

نُشر 2026-08-19
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ahmet Burak Elbeyli, Hasan Hüseyin Kır

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

يعيش الملايين من الناس مع الصداع النصفي (الشقيقة)، وهي حالة تتجاوز كونها مجرد صداع بسيط لتسبب عجزاً كبيراً وتعطل الحياة اليومية. ولأن أعراض الصداع النصفي قد تشبه أحياناً أعراض السكتة الدماغية أو حالات دماغية خطيرة أخرى، غالباً ما يلجأ المرضى إلى الإنترنت بحثاً عن إجابات. وفي السنوات الأخيرة، أصبح نوع جديد من البرامج الحاسوبية المعروف باسم "نماذج اللغات الكبيرة" مصدراً شائعاً لهذه المعلومات. تستطيع هذه الأنظمة قراءة كميات هائلة من النصوص وتوليد إجابات تشبه الإجابات البشرية لأي سؤال تقريباً، مما يوفر تفسيرات فورية حول التشخيص، والمحفزات، والعلاجات. ومع ذلك، ولأن هذه البرامج ليست أطباء، هناك قلق حقيقي من أنها قد تقدم نصائح غير مكتملة، أو تغفل عن علامات تحذيرية خطيرة، أو تقدم طمأنة في حين يحتاج الشخص فعلياً إلى رعاية طبية عاجلة.

ولفهم مدى جودة أداء هذه الأدوات الرقمية في سياق طبي عالي الخطورة، أجرى الباحثون مقارنة مباشرة بين اثنين من أكثر الأنظمة تقدماً المتاحة: GPT-4o وDeepSeek-V3. ركزت الدراسة تحديداً على الأسئلة الشائعة التي يطرحها الناس حول الصداع النصفي. جمع الباحثون مائة سؤال متميز من مصادر واقعية، بما في ذلك اتجاهات البحث عبر الإنترنت والنقاشات في المنتديات العامة حيث يشارك المرضى تجاربهم. غطت هذه الأسئلة نطاقاً واسعاً من المواضيع، بدءاً من طبيعة الأعراض التحذيرية ومحفزات نمط الحياة، وصولاً إلى سلامة الأدوية والنتائج طويلة الأمد. ولضمان أن يكون التقييم عادلاً وغير منحاز، قام طبيبان متخصصان في أمراض الأعصاب بمراجعة الإجابات التي ولدها كل نموذج دون معرفة أي برنامج حاسوبي هو الذي أنتجها. وقاما بتقييم الردود بناءً على مدى دقة الحقائق الطبية، ومدى اكتمال المعلومات، وما إذا كان الأسلوب متعاطفاً وداعماً، والأهم من ذلك، ما إذا كانت النصيحة آمنة ليتبعها المريض.

أظهرت النتائج أن كلا البرنامجين الحاسوبيين قدما بشكل عام معلومات دقيقة وآمنة، ونجحا في التعرف على الحاجة إلى طلب المساعدة الطبية المهنية عند ذكر علامات تحذيرية خطيرة. ومع ذلك، تفوق أحد النظامين، وهو DeepSeek-V3، باستمرار على الآخر في مجالات محددة؛ فقد قدم إجابات أكثر اكتمالاً، مما يضمن حصول المرضى ليس فقط على الحقائق الأساسية، بل أيضاً على السياق الضروري حول البدائل والشكوك. علاوة على ذلك، كانت النصوص التي ولدها DeepSeek-V3 أسهل بكثير في القراءة والفهم، حيث استخدم تراكيب جمل أبسط ولغة أكثر وضوحاً. وبينما أظهر كلا النموذجين مستويات متشابهة من التعاطف في نبرتهما، وكلاهما كان آمناً بما يكفي لاعتبارهما أدوات مفيدة، إلا أن الفرق في الاكتمال وسهولة القراءة كان واضحاً وذا دلالة إحصائية.

وفي اختبار محدد تضمن خمسة وعشرين سؤالاً تصف أعراض "العلامات الحمراء" الخطيرة، مثل صداع مفاجئ هو الأسوأ على الإطلاق أو مشاكل عصبية جديدة، أدى كلا النموذجين أداءً جيداً من خلال التحديد الصحيح للحاجة إلى رعاية عاجلة. ومع ذلك، حتى في هذه السيناريوهات الحرجة، حافظ النظام الذي أنتج النص الأكثر وضوحاً وسهولة في القراءة على ميزته. وخلص الباحثون إلى أنه بينما أصبحت أدوات الذكاء الاصطنا هذه حليفاً قوياً للتعليم الطبي للمرضى، إلا أنها لا ينبغي أبداً أن تحل محل التقييم الطبي للطبيب. بدلاً من ذلك، فإن أفضل استخدام لها هو مساعدة الناس على فهم المفاهيم العامة والتعرف على متى يحتاجون إلى طلب المساعدة المهنية، بشرط مراجعة إجاباتها بعناية. وتسلط الدراسة الضوء على أنه مع تطور هذه التقنيات، فإن قدرتها على توصيل الأفكار الطبية المعقدة ببساطة واكتمال لا تقل أهمية عن دقة الحقائق التي تقدمها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →