Semantic Bandits: In-Context Exploration-Exploitation is Biased by Semantic Priors
이 논문은 '시맨틱 밴딧(semantic bandit)' 프레임워크를 도입하여, 대규모 언어 모델의 탐색-활용(exploration-exploitation) 트레이드오프가 사전 학습에서 유도된 의미론적 사전 지식에 의해 상당히 편향된다는 점을 입증하며, 여기서 정보가 풍부한 레이블은 보상과의 정렬 여부에 따라 성능을 향상시키거나 저하시킬 수 있고, 음의 보상은 기대 규모 편향으로 인해 탐색을 불균형하게 촉발한다는 것을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거의 모든 책, 기사, 그리고 인터넷상의 웹사이트를 읽은 컴퓨터 프로그램이 있다고 상상해 보십시오. 이 프로그램은 시를 쓰고, 수학 문제를 풀며, 놀라울 정도로 인간처럼 느껴지는 대화를 나눌 수 있습니다. 이것이 바로 거대 언어 모델입니다. 이제 이 프로그램에게 최선의 보상을 얻기 위해 일련의 선택을 내려야 하는 직업을 준다고 상상해 보십시오. 마치 농부가 어느 밭에 작물을 심을지 결정하거나, 추천 엔진이 고객에게 어떤 셔츠를 보여줄지 고르는 것과 같습니다. 이것은 의사결정 과제입니다. 컴퓨터 과학의 세계에는 에이전트가 경험으로부터 얼마나 잘 학습하는지를 테스트하는 고전적인 방법이 있는데, 바로 '멀티 암드 밴딧(multi-armed bandit)' 문제입니다. 이는 카지노에 있는 한 줄의 슬롯머신에서 이름을 따왔으며, 각 머신은 서로 다른, 알려지지 않은 배당금을 가지고 있습니다. 가장 많은 돈을 따기 위해서는 두 가지 상충하는 필요성을 균형 있게 조절해야 합니다. 즉, 현재 가장 많이 배당을 주는 머신에 계속 매달릴 것인지, 아니면 다른 머신이 실제로 더 나을 수도 있으니 다른 것들을 시도해 볼 것인지 사이의 균지입니다. 이 균형을 '탐색(exploration) 대 활용(exploitation)'이라고 부릅니다. 수십 년 동안 연구자들은 이를 수학적으로 해결하는 방법을 연구해 왔습니다. 하지만 연구자들이 이 강력한 언어 모델들을 의사결정자로 사용하기 시작했을 때, 그들은 이상한 점을 발견했습니다. 모델들이 단순히 숫자만을 보는 것이 아니라, 단어들을 읽고 있었던 것입니다.
맥길 대학교와 밀라(Mila)의 연구팀은 이 현상을 조사하기 위해 '시맨틱 밴딧(semantic bandit)'이라는 새로운 종류의 테스트를 만들어 조사하기로 했습니다. 표준적인 테스트에서 선택지들은 '암 A' 또는 '암 B'와 같은 중립적인 코드로 표시됩니다. 이 새로운 테스트에서 연구자들은 '신성한(divine)', '순한(mild)', 또는 '고약한(nasty)'과 같이 의미를 담고 있는 이름들을 선택지에 부여했습니다. 그들은 컴퓨터가 자신이 수집하고 있는 실제 데이터보다 단어의 의미를 우선시하게 될지 확인하고 싶었습니다. 그들은 컴퓨터가 세 개의 밭 중에서 하나를 선택하는 농부 역할을 하는 시나리오를 설정했습니다. 각 밭은 무작위적인 양의 작물 수확량을 생산하며, 목표는 시간이 지남에 따라 총 수확량을 극대화하는 것입니다. 연구자들은 밭의 품질을 암시하는 이름을 붙였습니다. 한 버전에서는 가장 좋은 밭의 이름이 '신성한'이었고, 가장 나쁜 밭의 이름은 '고약한'이었습니다. 또 다른 버전에서는 이 이름들을 뒤바꾸어, 가장 좋은 밭을 '고약한'이라 부르고 가장 나쁜 밭을 '신성한'이라 불렀습니다.
결과는 놀라웠습니다. 이름이 실제 밭의 현실과 일치할 때, 즉 '신성한' 밭이 실제로 가장 많은 작물을 생산할 때, 컴퓨터는 믿기 힘들 정도로 빠르게 학습했습니다. 컴퓨터는 거의 즉시 다른 밭들을 시도하는 것을 멈추고 '신성한' 밭에 매달렸으며, 매우 적은 시행착오만으로 완벽한 점수를 달성했습니다. 그러나 이름이 오해의 소지가 있을 때, 컴퓨터는 치명적인 오류를 범했습니다. 데이터가 최악의 수확량을 보여주고 있음에도 불구하고, 컴퓨터는 '신성한' 밭이 최고라고 확신했습니다. 컴퓨터는 증거를 무시하고 '신성한' 밭을 계속 선택했으며, 그 사이 '고약한' 밭(실제로는 가장 좋은 밭)은 손도 대지 않은 채 남겨졌습니다. 컴퓨터는 숫자에 따라 행동한 것이 아니라, 훈련 과정에서 읽은 수십억 개의 단어로부터 학습한 연상 작용에 따라 행동한 것이었습니다. 컴퓨터는 '신성한'은 보통 좋다는 것을 의미하고 '고약한'은 나쁘다는 것을 의미한다는 것을 배웠으며, 눈앞의 구체적인 숫자가 무엇을 말하든 그 규칙을 적용했습니다.
연구자들은 또한 컴퓨터가 양수와 음수에 다르게 반응한다는 것을 발견했습니다. 컴퓨터가 음수의 보상(손실이나 벌칙)을 받았을 때, 컴퓨터는 갑자기 훨씬 더 호기심이 많아졌습니다. 컴퓨터는 다시 모든 다양한 옵션을 시도하기 시작했고, 높은 에너지로 알려지지 않은 밭들을 탐색했습니다. 하지만 양수의 보상을 받았을 때는, 아주 작은 보상일지라도, 탐색을 멈추고 자신이 알고 있는 것에 안주하는 경향을 보였습니다. 이는 컴퓨터가 숫자를 진공 상태의 추상적인 신호로 보는 것이 아님을 시사합니다. 대신, 컴퓨터는 텍le 데이터에서 보상이 어떻게 묘사되는지에 의해 형성된, 무엇이 '정상적인' 보상인지에 대한 내부적인 기대치를 가지고 있는 듯합니다. 음수는 그 기대를 너무 심하게 깨뜨려 컴퓨터가 모든 것을 재평가하도록 강제하는 반면, 양수는 안전하게 느껴지며 계속 나아가도록 독려합니다.
이러한 행동은 특정 컴퓨터 모델에만 국한되지 않았습니다. 연구자들은 오픈 소스 시스템부터 고급 상업용 버전까지 세 가지 서로 다른 거대 언어 모델을 테스트했으며, 모두 동일한 편향을 보였습니다. 그 효과는 너무 강력해서 단순한 의사결정 문제를 실패로 몰아넣을 수 있었습니다. 고전적인 컴퓨터 프로그램이라면 몇 단계 만에 해결했을 작업에서도, 언어 모델은 단어가 약간만 오해의 소지가 있어도 완전히 실패할 수 있었습니다. 연구자들은 컴퓨터에게 이름을 무시하고 계속 탐색하라고 지시사항에 명시적으로 알려줌으로써 이 문제를 부분적으로 해결할 수 있다는 것을 발견했지만, 편향은 깊게 뿌리박혀 있었습니다. 경고가 있음에도 불구하고, 모델들은 단어의 의미와 숫자의 현실을 분리하는 데 종종 어려움을 겪었습니다.
연구는 의사결정 환경을 설명하기 위해 언어를 사용하는 것이 피할 수 없는 편향을 도입한다는 결론을 내립니다. 이 모델들은 인간의 텍스트 속에 나타나는 단어들의 공생 관계를 통해 훈련되기 때문에, 세상이 어떻게 돌아가는지에 대한 일련의 가정을 지니고 있습니다. 이러한 가정이 과제와 일치할 때, 모델은 천재가 되어 기존의 알고리즘보다 더 빠르게 학습합니다. 하지만 가정이 충돌할 때, 모델은 단어가 들려주는 이야지를 따르느라 너무 바빠서 명백한 증거를 무시하는 고집스러운 존재가 됩니다. 이것은 코드의 버그가 아니라, 이 시스템들이 언어로부터 학습하는 방식의 특징입니다. 이러한 모델들이 금융 자문에서 자율 주행에 이르기까지 실생활에 배치됨에 따라, 언제 그들의 언어적 직관이 도움이 되고 언제 그들을 잘못된 길로 인도하는지 이해하는 것은 매우 중요합니다. 연구자들은 가장 단순한 의사결정 시나리오에서도, 버튼의 라벨을 바꾸는 것만으로 컴퓨터가 최악의 선택을 하도록 속일 수 있다는 것을 발견했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.