How much does context affect the accuracy of AI health advice?
تُظهر هذه الدراسة أن دقة النماذج اللغوية الكبيرة في التحقق من الادعاءات الصحية تعتمد بشكل كبير على السياقات اللغوية والموضوعية والمصدرية، مما يكشف عن فجوات أداء كبيرة في اللغات غير الإنجليزية وفي السيناريوهات الواقعية المعقدة التي تتحدى إمكانية تعميم معايير القياس المعتمدة على اللغة الإنجليزية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك فريقاً من سبعة روبوتات فائقة الذكاء (روبوتات الدردشة الآلية) بدأ الجميع يثق فيهم للحصول على نصائح طبية. تسألهم: "هل هذه النصيحة الصحية صحيحة؟" فيجيبون بـ "نعم" أو "لا".
هذه الورقة البحثية تشبه شهادة درجات لهؤلاء الروبوتات، ولكن مع لمسة مختلفة: المعلمون لا يتحققون فقط مما إذا كان الروبوت يجيب بشكل صحيح باللغة الإنجليزية فحسب، بل وفي 21 لغة مختلفة، وليس فقط في الحقائق البسيطة، بل في قصص الأخبار الواقعية المليئة بالتفاصيل.
إليك تفصيل لما وجدوه، باستخدام بعض التشبيهات من الحياة اليومية:
1. اختبار "الكتاب المدرسي" مقابل اختبار "الخبرة في الشارع"
لقد أخضع الباحثون الروبوتات لنوعين مختلفين تماماً من الاختبارات:
الاختبار أ: كتاب القواعد الرسمي (الـ "كتاب المدرسي")
استخدموا قائمة بالادعاءات الصحية المعتمدة قانونياً من قبل حكومات المملكة المتحدة والاتحاد الأوروبي (مثل "فيتامين سي يدعم جهاز المناعة").- النتيجة: كانت الروبوتات مثل الطلاب المتفوقين عندما تتحدث الإنجليزية أو اللغات القريبة من الإنجليزية (مثل الإسبانية أو الفرنسية)؛ حيث أصابت في حوالي 97% من هذه الادعاءات.
- العقبة: كلما ابتعدت اللغة عن الإنجليزية (مثل الفارسية، الهندية، أو الكورية)، بدأت الروبوتات في التعثر. الأمر يشبه طالباً حفظ الكتاب المدرسي بالإنجليزية، لكنه يرتبك عندما يغير المعلم اللغة إلى لغة ذات بنية قواعدية مختلفة تماماً.
الاختبار ب: موجز الأخبار الواقعي (الـ "خبرة في الشارع")
بعد ذلك، اختبروا الروبوتات على 9,000 ادعاء صحي حقيقي وُجدت في مقالات إخبارية، وتقارير حكومية، ومنصات التواصل الاجتماعي (تغطي مواضيع مثل كوفيد-19، الإجهاض، والسياسة).- النتيجة: هنا واجهت الروبوتات صعوبة حقيقية. انخفضت دقتها بشكل كبير. كانت مثل السياح المرتبكين الذين يحاولون التنقل في مدينة صاخبة ومزدحمة.
- النمط:
- كانوا الأفضل في رصد الحقائق في مقتطفات الأخبار البسيطة والمباشرة (مثل "تقول مراكز السيطرة على الأمراض والوقاية منها...").
- كانوا الأسوأ في فهم الملخصات العلمية المعقدة (مثل تلك الموجودة في مجلة Nature) أو النصائح الصحية العامة. هذه تشبه محاولة قراءة عقد قانوني كثيف وأنت ترتدي نظارات ضبابية.
2. لماذا يفشلون؟ (السبب وراء الأخطاء)
تشير الورقة البحثية إلى ثلاثة أسباب رئيسية تجعل الروبوتات غير مثالية:
- تحيز المكتبة (بيانات التدريب): تم تدريب الروبوتات غالباً على "الإنترنت المفتوح". هذا يشبه مكتبة تحتوي على ملايين النسخ من نيويورك تايمز وفوكس نيوز (جمل قصيرة وقوية) ولكن بها نسخ قليلة جداً من Nature (علوم معقدة ودقيقة). الروبوتات بارعة في قراءة الصحف، لكنها سيئة في قراءة الدوريات العلمية.
- مشكلة "التحوط" (التدقيق): العلم الحقيقي غالباً ما يستخدم كلمات مثل "قد"، "يمكن"، أو "يشير إلى". الروبوتات تفضل العبارات الواضحة والجريئة. عندما تقول جملة ما: "هذا الدواء قد يساعد"، يرتبك الروبوت وقد يخمن بشكل خاطئ.
- فجوة "المتخصص": تم ضبط الروبوتات بكثافة للتعامل مع أزمة كوفيد-19 (مثل طالب درس فقط من أجل امتحان الرياضيات النهائي). ولكن عندما سُئلت عن السياسة أو الصحة العامة، لم تكن لديها تلك "التدريبات المتخصصة" نفسها، لذا ارتكبت المزيد من الأخطاء.
3. التحذير الكبير
الخلاصة الأساسية هي بمثابة "ملصق تحذيري" لأي شخص يفكر: "مهلاً، هذا الذكاء الاصطناعي يعمل بشكل رائع بالإنجليزية، إذاً لا بد أنه آمن للجميع".
هذا ليس صحيحاً.
الاعتماد على ذكاء اصطناعي يتحدث الإنجليزية لتقديم نصيحة صحية بلغة أخرى أو في موضوع معقد، يشبه استئجار مرشد سياحي يعرف فقط وسط المدينة ليرشدك في الشوارع الخلفية الخطيرة والمتعرجة. قد يجعلك تضل طريقك، أو الأسوأ من ذلك، قد يعطيك اتجاهات خطيرة.
4. ماذا يجب أن نفعل؟
يقترح المؤلفون ألا نفترض أن الروبوتات جاهزة للعالم أجمع. بدلاً من ذلك:
- الاختبار محلياً: قبل السماح للذكاء الاصطناعي بتقديم نصيحة صحية في بلد أو لغة معينة، نحتاج لاختباره خصيصاً لتلك الثقافة وتلك اللغة.
- وجود الإنسان في الحلقة: بالنسبة للمسائل الصحية الخطيرة، يجب على خبير بشري مراجعة عمل الروبوت، خاصة عندما يكون الموضوع معقداً أو اللغة نادرة.
- بناء مكتبات أفضل: نحن بحاجة لتدريب هذه الروبوتات على بيانات علمية أكثر تنوعاً وعالية الجودة بلغات عديدة، وليس الإنجليزية فقط.
باختاً: النصيحة الصحية من الذكاء الاصطناعي هي أداة قوية، لكنها حالياً تشبه بدلة "مقاس واحد يناسب الجميع"، فهي تناسب المتحدثين بالإنجليزية جيداً، لكنها ضيقة جداً أو واسعة جداً بالنسبة للآخرين. نحن بحاجة لتفصيل هذه البدلة قبل أن نسمح للروبوت بدخول المستشفى.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.