← 최신 논문
💬 NLP

Conditional Cognitive Biases in LLMs: How Biased User Turns Modulate In-Context Reasoning

이 논문은 8개 모델에 걸친 24,000개 이상의 검증된 프롬프트에 대한 종합적인 벤치마크를 바탕으로, 다회차 대화에서의 편향된 사용자 입력이 최첨단 거대언어모델(LLM)의 인지적 편향 발현을 어떻게 조절하는지를 평가하며, 대화 노출이 일반적으로 편향을 증폭시키는 반면 명시적인 편향 단서가 외적인 편향을 억제하는 정렬 메커니즘을 촉발할 수 있음을 밝힌다.

원저자: Sachini Weerasekara, Sagar Kamarthi, Jacqueline Isaacs

게시일 2026-08-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sachini Weerasekara, Sagar Kamarthi, Jacqueline Isaacs

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거의 모든 책을 읽은 초지능 로봇과 함께 한 방에 앉아 있다고 상상해 보세요. 당신이 질문을 던지면 로봇은 답을 줍니다. 하지만 여기 반전이 있습니다. 이 로봇은 도움이 되고, 정직하며, 해롭지 않도록 설계되었습니다. 이제 당신은 단순히 질문을 하는 것이 아니라, 대화를 나누고 있다고 상상해 보세요. 실제 대화에서 사람들은 자신도 모르게 자신의 의견, 걱정, 혹은 사고의 지름길을 슬쩍 끼워 넣곤 합니다. 이러한 정신적 지름길을 **인지 편향(cognitive biases)**이라고 부릅니다. 예를 들어, 만약 당신이 로봇에게 "모두가 이 주식이 폭락할 거라고 알고 있어!"(편향의 일종인 밴드왜건 효과)라고 말하거나, "이 프로젝트는 분명 이틀이면 끝날 거야!"(편로 오류인 계획 오류)라고 말한다면, 당신은 본질적으로 로봇에게 특정한 색이 들어간 안경을 건네주는 것과 같습니다. 과학자들이 던져온 핵심적인 질문은 이것입니다. 로봇은 그 안경을 그냥 정중하게 무시할까요, 아니면 그 안경을 쓰고 당신이 보는 방식으로 세상을 보기 시작할까요? 이것이 중요한 이유는 우리가 의료 조언을 주거나 법적 결정을 돕는 것과 같은 심각한 업무에 이 로봇들을 사용하기 시작했기 때문입니다. 만약 편향된 인간이 실수로 자신의 잘못된 사고를 로봇에게 "감염"시킬 수 있다면, 그 결과는 엄청날 수 있습니다.

노스이스턴 대학교의 연구진은 오늘날 가장 발전된 8개의 AI 로봇을 대상으로 탐정 놀이를 하기로 했습니다. 그들은 24,000개 이상의 서로 다른 대화 시나리오를 포함하는 거대한 실험을 설계했습니다. 이것은 AI를 위한 거대한 "사이먼 가라사대(Simon Says)" 게임과 같지만, 박수를 치거나 점프하는 대신 로봇은 돈, 시간, 공정성 등에 관한 결정을 내려야 했습니다. 연구진은 로봇에게 말을 거는 세 가지 다른 방식을 만들었습니다:

  1. 솔로 테스트(The Solo Test): 로봇이 대화 기록 없이 질문을 받는 방식(우리가 보통 그들을 테스트하는 표준적인 방식).
  2. 중립적 채팅(The Neutral Chat): 로봇이 질문을 받기 전, 인간이 "안녕하세요, 논의해 봅시다"와 같이 지루하고 중립적인 말을 먼저 하는 방식.
  3. 편향된 채팅(The Biased Chat): 로봇이 질문을 받기 전, 인간이 "이것은 쉽고 빠를 것이라고 확신해요!"와 같이 특정 인지 편향이 담긴 말을 먼저 하는 방식.

연구진은 로봇의 답변이 단지 누군가와 대화를 하고 있다는 사실 때문에 변하는지(즉, "존재" 효과), 아니면 그 사람이 말하는 내용 때문에 변하는지(즉, "내용" 효과)를 알아보고 싶었습니다.

그들이 발견한 결과는 단순한 "예/아니오"로 답하기에는 다소 복잡합니다. 첫째, 단순히 대화를 나누는 것만으로도 로봇이 변한다는 사실을 발견했습니다. 인간이 완전히 중립적인 말을 하더라도, 로봇은 혼자서 답변할 때보다 약간 더 편향된 모습을 보이는 경향이 있습니다. 이는 마치 로봇이 조금 더 "사회적"이 되어, 인간이 속이려 하지 않더라도 인간의 존재를 거울처럼 반영하기 시작하는 것과 같습니다.

하지만 진짜 놀라운 점은 인간이 명시적으로 편향되었을 때 나타났습니다. 6개의 로봇에서 연구진은 흥end로운 줄다리기를 발견했습니다. 한편으로, 로봇은 인간이 명백하게 편향된 태도를 보일 때 작동하는 "안전 스위치"를 가진 것처럼 보였습니다. 마치 로봇이 "오, 이 사람은 불공정하거나 지나치게 낙관적이군요. 나는 좀 더 주의를 기울이거나 이들을 바로잡아야겠습니다"라고 생각하는 것과 같습니다. 이로 인해 로봇은 인간의 편향에 대응하여 오히려 자신의 편향을 줄이는 결과를 보였습니다. 이는 마치 로봇이 인간의 "나쁜 경찰"에 맞서 "착한 경찰"이 되려는 것과 같습니다.

그러나 주요한 예외가 하나 있었습니다. 연구진은 특정 유형의 편향인 계획 오류(업무가 실제보다 적은 시간과 비용이 들 것이라고 생각하는 경향)가 로봇들이 도저히 싸워 이길 수 없는 "슈퍼 바이러스"와 같다는 것을 발견했습니다. 어떤 로봇을 테스트하더라도, 그리고 인간이 속이기 위해 어떤 종류의 편향을 사용하더라도, 로봇들은 인간이 낙관적일 때 시간과 비용에 대해 일관되게 더 낙관적인 태도를 보였습니다. 계획에 있어서는, 로봇들이 인간의 "그럴 거야, 쉬울 거야"라는 분위기에 매우 취약하다는 것을 보여줍니다.

또한 연구진은 몇 가지 가설을 배제했습니다. 그들은 인간과 로봇이 동일한 편향을 공유하는 것(예: 손실 회피 편향을 가진 인간이 손실 회피 편향을 가진 로봇을 속이는 것)이 원인이 아님을 증명했습니다. 로봇의 반응은 인간의 편향이 로봇의 편향과 일치하는지 여부보다는, 로봇이 어떤 편향에 대해 테스트받고 있는지에 더 달려 있었습니다. 또한, 더 크고 똑똑한 로봇이 편향을 무시하는 데 반드시 더 나은 성능을 보이는 것도 아니었습니다. 실제로 가장 발전된 모델들도 작은 모델들만큼이나 쉽게 휘둘렸습니다.

요약하자면, 이 논문은 AI 로봇이 명백한 인간의 편향에 대한 내장된 방어 기제를 가지고 있지만, 결코 면역이 있는 것은 아니라고 시사합니다. 우리는 그들과 대화한다는 사실만으로도 미묘하게 영향을 미칠 수 있으며, 낙관적인 계획에 대해서는 특정한 약점을 가지고 있습니다. 연구진은 우리가 이 로봇들이 실제 세상에서 어떻게 행동하는지 알고 싶다면, 고립된 질문으로 테스트하는 것이 아니라, 인간이 실수로 혹은 의도적으로 그들에게 색이 들어간 안경을 건네줄 수 있는 복잡하고 다회차적인 대화 속에서 테스트해야 한다고 경고합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →