← أحدث الأبحاث
🧬 biology

OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries

تُثبت هذه الورقة أن DR. INFO، وهو مساعد طبي قائم على تقنية RAG والوكلاء الذكيين، يتفوق بشكل كبير على النماذج اللغوية الكبيرة الرائدة والأنظمة السريرية المنافسة في اختبار HealthBench Hard، مما يؤكد فعالية التقييمات المفتوحة القائمة على المعايير لتقييم الاستدلال السريري والتواصل عالي الخطورة.

المؤلفون الأصليون: Sandhanakrishnan Ravichandran, Shivesh Kumar, Rogerio Corga Da Silva, Miguel Romano, Reinhard Berkels, Michiel van der Heijden, Olivier Fail, Valentine Emmanuel Gnanapragasam

نُشر 2026-07-28
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Sandhanakrishnan Ravichandran, Shivesh Kumar, Rogerio Corga Da Silva, Miguel Romano, Reinhard Berkels, Michiel van der Heijden, Olivier Fail, Valentine Emmanuel Gnanapragasam

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ⚕️ هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت فائق الذكاء كيف يصبح طبيباً. لفترة طويلة، اختبرنا هذه الروبوتات باستخدام اختبارات متعددة الخيارات، مثل تلك التي قد تراها في امتحان أحياء للمرحلة الثانوية. كنت تسأله: "ما هي عاصمة فرنسا؟" أو "أي دواء يعالج الصداع؟" وسيقوم الروبوت باختيار أ، ب، أو ج. إذا أجاب بشكل صحيح، كنا نفترض أنه مستعد لمساعدة البشر الحقيقيين. ولكن هنا تكمن المشكلة: الحياة الواقعية ليست اختباراً متعدد الخيارات. الحياة الواقعية فوضوية، ومربكة، ومليئة بالتفاصيل المفقودة. قد يكون المريض خائفاً، أو ينسى ذكر عرض معين، أو يطرح سؤالاً بطريقة لا تتناسب مع قالب مرتب. إذا قام الروبوت فقط بحفظ الحقائق دون أن يتمكن من الاستماع، أو طرح الأسئلة التتبعية الصحيحة، أو الاعتراف عندما يكون غير متأكد، فقد يرتكب أخطاءً خطيرة. وهنا يأتي نوع جديد من الاختبار، مصمم ليس ليرى ما إذا كان الروبوت يعرف إجابات الكتاب المدرسي، بل ليرى كيف يتصرف في محادثة حقيقية تحت ضغط عالٍ.

هذه الورقة البحثية تتحدث عن فريق في شركة تدعى "سيندكت" (Synduct) قاموا ببناء مساعد روبوت طبي يُدعى DR. INFO. أرادوا معرفة ما إذا كان الروبوت الخاص بهم مستعداً بالفعل للعالم الحقيقي، لذا وضعوه تحت اختبار جديد وأكثر صعوبة يسمى HealthBench. على عكس الاختبارات القديمة، فإن HealthBench يشبه لعبة تقمص أدوار ضخمة تحتوي على 1,000 سيناريو صعب. في هذه السيناريوهات، يلعب إنسان دور المريض (أو الطبيب) ويطرح سؤالاً صعباً، ويجب على الروبوت الرد. ثم يقوم فريق من الأطباء الحقيقيين بتقييم إجابة الروبوت بناءً على قائمة مراجعة مفصلة (تسمى معايير التقييم) تنظر في أمور مثل: هل قال الروبوت الحقيقة؟ هل طلب مزيداً من المعلومات عندما كانت الأمور غير واضحة؟ هل ظل هادئاً وواضحاً؟ هل اتبع التعليمات؟

كانت النتائج مفاجئة للغاية. عندما خاض DR. INFO هذا الاختبار الصعب، سجل 0.68 من 1.0. ولوضع ذلك في منظوره، قارنت الورقة بين DR. INFO وأفضل نماذج الذكاء الاصطناعي الأكثر شهرة في العالم حالياً، بما في ذلك عائلة GPT-5 من OpenAI. سجلت نماذج GPT-5 درجات أقل بكثير، حيث حصل أفضل إصدار منها على 0.46 فقط. لم يتفوق DR. INFO عليهم فحسب، بل تفوق عليهم بشكل جوهري، محققاً درجة تمثل زيادة نسبية قدرها 48% عن المنافس الأول. كما كان أفضل في مهارات محددة مثل معرفة متى يطلب المزيد من السياق (حيث سجل 0.62 مقابل 0.16 لنموذج رائد آخر) وتقديم إجابات كاملة. كما اختبر الفريق DR. INFO ضد روبوتات طبية أخرى مصممة للقيام بمهام مماثلة، وفاز DR. INFO في تلك السباقات أيضاً، مسجلاً 0.72 مقارنة بدرجات منافسيه التي بلغت حوالي 0.49.

ومع ذلك، فإن المؤلفين حذرون من القول بأن الروبوت مثالي أو أن المشكلة قد "حُلّت". فقد وجدوا أنه بينما يعد DR. INFO رائعاً في اتباع التعليمات والدقة، إلا أنه لا يزال لديه مجال للنمو في كيفية فهم السياق الكامل للمحادثة ومدى اكتمال إجاباته. تشير الورقة إلى أن هذه الطريقة الجديدة من الاختبار — التي تنظر في السلوك بدلاً من مجرد الحقائق — هي المفتاح لبناء ذكاء اصطوي طبي آمن وجدير بالثقة. الأمر يشبه إدراك أنك لكي تكون سائقاً جيداً، لا تحتاج فقط لمعرفة قواعد الطريق، بل تحتاج أيضاً لمعرفة كيفية التصرف عندما يقفز سنجاب أمام سيارتك. يبدو أن DR. INFO يتعلم كيفية التعامل مع "السناجب" بشكل أفضل من الروبوتات الأخرى، لكن الرحلة نحو أن يصبح مساعداً طبياً مستقلاً تماماً لا تزال مستمرة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →