Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models
이 논문은 정적 벤치마크의 한계를 극복하고 의료용 대형 언어 모델의 신뢰성을 확보하기 위해, 견고성·개인정보·편향·환각 등 4 가지 안전 축을 실시간으로 스트레스 테스트하는 동적·자동화·체계적 (DAS) 레드팀 프레임워크를 제안하고, 이를 통해 기존 벤치마크 점수와 실제 동적 안정성 간에 심각한 격차가 있음을 입증했습니다.
Jiazhen Pan (Cherise), Bailiang Jian (Cherise), Paul Hager (Cherise), Yundi Zhang (Cherise), Che Liu (Cherise), Friedrike Jungmann (Cherise), Hongwei Bran Li (Cherise), Chenyu You (Cherise), Junde Wu (Cherise), Jiayuan Zhu (Cherise), Fenglin Liu (Cherise), Yuyuan Liu (Cherise), Niklas Bubeck (Cherise), Christian Wachinger (Cherise), Chen (Cherise), Chen (Cherise), Zhenyu Gong, Cheng Ouyang, Georgios Kaissis, Benedikt Wiestler, Daniel Rueckert2026-03-10🤖 cs.LG