What's in a Name? Morphological Shortcuts by LLMs in Pharmacology
이 논문은 약리학 분야의 거대 언어 모델들이 가상의 약물 특성을 추론할 때 흔히 형태론적 지름길, 구체적으로는 약물 이름의 접사(affix)에 의존한다는 사실을 밝히며, 이러한 행위는 모델의 초기-중기 층에 국한되어 나타나는데, 이는 과잉 일반화 및 이러한 단서에 대한 미표시된 의존성으로 인해 미묘하지만 측정 가능한 안전 위험을 초래한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: "접미사"라는 치트키
당신이 의학 시험을 보고 있다고 상상해 보세요. 당신은 특정 약물이 정확히 어떤 작용을 하는지는 모르지만, 그 이름이 "-cillin"(예: ampicillin)으로 끝난다는 사실을 알아차렸습니다. 당신은 penicillin과 amoxicillin이 항생제라는 것을 기억하고 있습니다. 그래서 당신은 "아, 이것도 항생제겠구나!"라고 추측합니다.
당신의 추측이 맞을 수도 있고, 틀릴 수도 있습니다. 하지만 정말 무서운 점은 바로 이것입니다. 거대 언어 모델(LLM)도 이와 똑같은 행동을 하고 있으며, 심지어 100%의 확신을 가지고 수행한다는 것입니다.
이 논문은 AI 모델이 사용하는 이러한 "지름길(shortcut)"을 조사합니다. AI는 특정 약물에 대한 실제 사실을 기억하는 대신, 단어의 형태(접두사와 접미사)를 보고 그 패턴에 기반하여 답을 추측합니다.
실험: "가짜 약" 테스트
연구진은 AI 모델이 단어의 형태에 속을 수 있는지 확인하고자 했습니다. 이를 위해 세 가지 유형의 단어를 만들어 테스트했습니다.
- 실제 약물: Ampicillin과 같은 실제 의약품.
- 가짜 약물 (함정): 실제 의학적 접미사를 사용하여 진짜처럼 들리도록 만든 가공의 이름입니다. 예를 들어, *"dimi"*라는 의미 없는 단어에 실제 항생제 접미사인 *"-cillin"*을 붙여 **"Dimicillin"**을 만들었습니다.
- 의미 없는 단어: *"Dimiglimto"*와 같이 의학적 의미가 전혀 없는, 만들어진 부분들로 구성된 단어.
결과:
AI에게 Dimicillin에 대해 물었을 때, AI는 "모르겠습니다, 그것은 가짜입니다"라고 말하지 않았습니다. 대신, AI는 **"네, Dimicillin은 세균 감염 치료에 사용되는 항생제입니다"**라고 자신 있게 대답했습니다.
AI는 완전히 만들어진 단어를 실제 단어와 똑같이 취급할 정도로 확신에 차 있었습니다. 단순히 그 단어가 "항생제"를 의미하는 "마법의 글자들"로 끝났기 때문입니다.
세 가지 주요 발견
논문은 이 현상이 정확히 어떻게, 왜 발생하는지 분석합니다.
1. "형태적 지름길" (행동 양식)
AI는 "생각"을 하는 것이 아니라 패턴을 매칭하고 있는 것입니다.
- 비유: 어떤 요리사가 특정 요리를 한 번도 해본 적은 없지만, 어떤 요리든 "-피자"로 끝나면 보통 치즈와 토마토가 들어간다는 것을 알고 있다고 상상해 보세요. 만약 누군가 그에게 "개-피자(Dog-pizza)"라고 적힌 접시를 건넨다면, 그는 "개-피자"라는 요리가 존재하지 않음에도 불구하고 자신 있게 치즈와 토마토에 대해 설명할 것입니다.
- 위험성: 의학 분야에서 이는 매우 위험합니다. 만약 의사가 AI에게 가짜 약물에 대해 묻는다면, AI는 가짜 치료법이나 부작용을 지어낼 수 있으며, 그 말투가 너무나 확신에 차 있기 때문에 인간은 그것을 믿게 될 수도 있습니다.
2. "숨겨진 추론" (진단)
연구진은 AI가 어디에서 정보를 얻는지 확인하기 위해 도구를 구축했습니다. 그 결과, 많은 약물에 대해 AI가 전체 이름보다는 주로 접미사(끝부분)에 의존한다는 것을 발견했습니다.
- 놀라운 점: AI는 이 사실을 거의 인정하지 않습니다. 왜 해당 약물이 항생제라고 생각하는지 묻더라도, AI는 "접미사가 -cillin으로 끝나기 때문입니다"라고 말하지 않습니다. 대신 마치 사실을 알고 있는 것처럼 자신 있게 답변을 내놓습니다. 이는 마치 질문이 익숙해 보여서 답을 찍어놓고, 실제로는 공부한 척하며 긴 에세이를 써 내려가는 학생과 같습니다.
- 혼란: AI는 접미사에 의존하기 때문에 실제 약물을 혼동하기도 합니다. 만약 두 개의 실제 약물이 모두 "-cillin"으로 끝난다면, AI는 두 약물의 형태가 비슷하다는 이유만으로 약물 A의 부작용을 약물 B의 것으로 잘못 전달할 수 있습니다.
3. "뇌 스캔" (메커니즘)
연구진은 AI의 "두뇌"(내부 계층) 내부를 들여다보고 어디에서 이 지름길이 발생하는지 살펴보았습니다.
- 위치: AI가 이 결정을 매우 초기 단계인, 신경망의 초기에서 중간 단계 계층에서 내린다는 것을 발견했습니다.
- 메커니즘: 이것은 클럽 입구에서 신분증(특정 약물에 대한 사실)은 확인하지 않고 오직 옷의 색깔(접미사)만 확인하고 통과시켜 주는 보안 요원과 같습니다. 일단 AI가 "올바른 색깔의 옷"을 보면, 즉시 "이것은 항생제다"라고 결정하고 더 이상의 세부 사항을 찾는 것을 멈춥니다.
- 희망적인 소식: 연구진은 이 현상이 AI의 뇌 어디에서 일起き는지 찾아냈기 때문에, 특정 계층을 미세하게 조정함으로써 이러한 행동을 "패치"하거나 수정할 수 있음을 보여주었습니다.
이 연구가 중요한 이유 (논문에 따르면)
논문은 이것이 단순한 특이한 현상이 아니라 안전 문제라고 결론짓습니다.
- 미묘합니다: AI는 매우 똑똑하고 자신감 있게 보입니다.
- 측정 가능합니다: 우리는 단어 패턴을 관찰함으로써 AI가 속임수를 쓰고 있다는 것을 증명할 수 있습니다.
- 수정 가능합니다: 지름길이 AI 코드의 어디에 존재하는지 알기 때문에, 단어의 형태에 기반해 의학적 사실을 지어내는 것을 막기 위한 안전 장치를 잠재적으로 구축할 수 있습니다.
요약하자면, 이 논문은 AI 모델이 때때로 "사실을 아는 존재"가 아니라 "단어 위를 서핑하는 존재(word-surfers)"라고 경고합니다. 의학처럼 중대한 분야에서 단어의 형태를 타고 서핑하는 것은, 자신감 넘치지만 완전히 허구인 의학적 조언으로 이어질 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.