JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
تقدم هذه الورقة البحثية JMedEthicBench، وهو أول معيار محادثة متعدد الأدوار لتقييم سلامة النماذج اللغوية الكبيرة الطبية باللغة اليابانية، والذي كشف أن النماذج المتخصصة أكثر عرضة للمخاطر من النماذج التجارية، وأن السلامة تتدهور بشكل ملحوظ عبر أدوار المحادثة بسبب قيود التوافق المتأصلة وليس بسبب عوامل متعلقة باللغة.