The strength of clinical evidence is recoverable from language model representations but not from their stated grades
대규모 언어 모델이 내부 표현 내에 회복 가능한 임상적 근거 강도의 신호를 인코딩하고 있음에도 불구하고, 이들은 해당 정보를 명시적으로 진술하는 데 일관되게 실패하며, 이로 인해 잠재적 신호의 존재에도 불구하고 그들이 선언한 근거 등급은 신뢰할 수 없게 된다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 아주 똑똑하고 박학다식한 사서들(AI 모델들)이 있다고 상상해 보세요. 그들의 임무는 단순히 의학적 사실이 무엇인지 알려주는 것이 아니라, 그 사실에 대해 우리가 얼마나 확신하는지를 알려주는 것입니다. 그것이 수천 건의 연구로 뒷받침되는 바위처럼 단단한 진실인지, 아니면 단 한 명의 의사가 가진 막연한 추측인지 말입니다.
이 논문은 단순한 질문을 던졌습니다. 이 사서들이 설령 겉으로 말하지 않더라도, 실제로 자신이 얼마나 확신하고 있는지 알고 있는가?
연구진이 발견한 내용을 쉬운 개념별로 정리하면 다음과 같습니다.
1. 사서의 내면에 있는 "비밀 라디오"
연구진은 테스트한 모든 AI 모델이 자신의 뇌(내부 컴퓨터 코드) 안에 "비밀 라디오" 신호를 가지고 있다는 것을 발견했습니다. 만약 당신이 이 라디오 주파수를 맞추는 법을 안다면, AI가 하는 어떤 주장에도 증거가 얼마나 강력한지 들을 수 있습니다.
- 함정: 사서들은 이 언어를 구사하는 데 매우 서툽니다. 당신이 직접 "이것에 대한 증거가 얼마나 강력합니까?"라고 물으면, 그들은 무작위로 추측합니다. 그들은 약한 추측에 대해서도 "높은 확신"이라고 말할 수도 있고, 바위처럼 단단한 사실에 대해서도 "낮은 확신"이라고 말할 수도 있습니다.
- 비유: 머릿속에 완벽하고 최첨단인 레이더를 갖추고 있어서 언제 폭풍이 올지 정확히 아는 기상 예보관을 상상해 보세요. 하지만 정작 라디오를 통해 당신에게 말할 때는 그냥 "맑을 수도 있고, 비가 올 수도 있다"며 무작별로 추측하는 것과 같습니다. 진실은 그들 내부에 있지만, 그것을 입 밖으로 내뱉지는 않는 것입니다.
2. 크다고 해서 더 나은 것은 아니다 (놀랍게도)
보통 우리는 더 크고 비싼 AI 모델이 더 똑똑할 것이라고 생각합니다. 연구진은 가장 큰 모델들이 가장 명확한 "비밀 라디오" 신호를 가지고 있을 것이라고 예상했습니다.
- 발견: 결과는 정반대였습니다. 가장 작은 모델들이 이 신호를 가장 잘 전달했습니다. 더 크고, "추론"하도록 특별히 훈련된 모델들은 오히려 읽기 가능한 신호를 갖추는 데 더 서툴렀습니다.
- 비유: 이는 아주 선명한 신호를 받는 작고 단순한 무전기를 가진 것과, 너무 복잡해서 신호가 온통 뒤섞여 버리는 거대하고 첨단화된 위성 전화기를 가진 것의 차이와 같습니다. 기계가 더 복잡해질수록, 그 내부의 확신을 "읽어내는 것"은 더 어려워집니다.
3. 신호는 대부분 "단어 선택"에 불과하다
연구진은 이 "비밀 라디오"가 실제로 무엇을 듣고 있는지 더 깊이 파고들었습니다. 그들은 이 신호가 "증거"에 대한 깊고 철학적인 이해에서 오는 것이 아님을 발견했습니다 문장 속에서 사용된 단어들을 주로 포착하고 있었습니다. 특정 문구(예: "연구에 따르면" 또는 "전문가 의견")는 AI에게 "헤이, 이것은 강한 주장이다" 또는 "헤이, 이것은 약한 주장이다"라고 알려주는 깃발 역할을 합니다.
- 비유: 이는 "산책"이라는 단어가 "밖으로 나가자"를 의미하고, "목욕"이라는 단어가 "안에 있자"를 의미한다는 것을 아는 강아지와 같습니다. 강아지는 산책이나 목욕이라는 개념을 생각하는 것이 아니라, 단지 특정 소리에 반응하는 것입니다. AI 역시 깊은 진리보다는 어휘에 반응하고 있는 것입니다.
4. "진실"과 "증거"의 혼동
현실 세계에서는 어떤 주장이 "강력하게 뒷받ำ될" 수는 있지만, 나중에 틀린 것으로 판명될 수도 있습니다(예를 들어, 수년간 유행했지만 나중에 틀린 것으로 밝혀진 의학적 관행처럼 말이죠).
- 발견: 연구진은 "이것이 사실인가?"와 "이것이 얼마나 잘 뒷받침되는가?"를 구분하기 위해 특별한 테스트를 구축했습니다. 그 결과, AI의 "얼마나 잘 뒷받침되는가"에 대한 내부 신호는 "이것이 사실인가?"에 대한 신호와 실제로 다르다는 것을 발견했습니다.
- 비유: 법정을 생각해 보세요. "증거 신호"는 증언의 질에 대한 배심원의 확신과 같습니다. "진실 신호"는 실제 유죄 또는 무죄라는 평결입니다. AI는 설령 피고인이 실제로 죄를 지었더라도(진실), 그 증언이 미흡했다(낮은 증거)는 것을 알려줄 수 있습니다. 이 두 가지는 서로 다른 것이며, AI는 이를 자신의 뇌 속에서 분리하여 유지합니다. 비록 그것을 말로 내뱉지는 않더라도 말입니다.
5. 실질적인 시사점
AI는 자신의 증거가 얼마나 강력한지 스스로 말해주지 않기 때문에, AI가 내뱉는 말 자체를 믿을 수는 없습니다. 하지만 기계 내부에는 신호가 존재하기 때문에, 별도의 간단한 컴퓨터 프로그램이 AI의 뇌를 "듣고" 인간이 확인해야 할 약한 주장들을 걸러낼 수 있습니다.
- 경고: AI에게 자기 숙제를 채점하라고 믿어서는 안 됩니다. 하지만 AI의 "내부 메모"를 읽어 의사나 환자에게 도달하기 전에 실수를 잡아내는 간단한 도구를 만들 수는 있습니다.
요약
이 논문은 현재의 의료용 AI 모델들이 침묵하는 전문가와 같다고 결론짓습니다. 그들은 사실과 막연한 추측의 차이를 알고 있지만, 그것을 입 밖으로 내뱉기를 거부합니다. 또한 그들은 깊은 논리적 증거를 이해하기보다는 특정 단어들에 반응하고 있을 뿐입니다. 우리가 그들에게 말을 하게 만들거나 그들의 "침묵하는 생각"을 읽어낼 도구를 만들기 전까지는, 그들이 주장하는 확신 수준을 신뢰해서는 안 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.