← 최신 논문
🤖 AI

CoBRA: Programming Cognitive Bias in Social Agents Using Classic Social Science Experiments

이 논문은 인지 편향 지수(Cognitive Bias Index)와 행동 조절 엔진(Behavioral Regulation Engine)을 결합한 폐쇄 루프 시스템을 활용하여 고전적인 사회 과학 실험을 체계적으로 실행함으로써, 연구자들이 서로 다른 모델을 사용하는 LLM 기반 사회적 에이전트 전반에 걸쳐 인지 편향을 명시하고 일관되게 제어할 수 있도록 하는 새로운 툴킷인 CoBRA를 소개한다.

원저자: Xuan Liu, Haoyang Shang, Haojian Jin

게시일 2026-01-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xuan Liu, Haoyang Shang, Haojian Jin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 인간의 행동에 관한 연극을 위해 배우를 캐스팅하려는 감독이라고 상상해 보십시오. 과거에는 만약 당신이 배우에게 "고집 센 경제학자"를 연기하길 원했다면, 그저 "당신은 고집 센 경제학자입니다"라고 말했을 것입니다. 당신은 그들이 역할을 이해하고 그에 따라 행동하기를 바랐을 뿐입니다.

문제는, 이 논문이 발견했듯이, 이러한 단순한 지시를 서로 다른 배우들(이 경우에는 서로 다른 AI 모델들)이 매우 다르게 해석한다는 점입니다. 어떤 이는 고집스럽게 행동할 것이고, 어떤 이는 혼란스러워할 것이며, 또 다른 이는 완전히 정반대로 행동할 수도 있습니다. 이는 마치 세 명의 서로 다른 사람에게 똑같은 대본을 주고 세 개의 완전히 다른 공연을 얻는 것과 같습니다. 이로 인해 어떤 "연극"(시뮬레이션)을 실행하더라도 그 결과가 이야기 때문인지, 아니면 배우의 무작위적인 해석 때문인지 알 수 없으므로 결과를 신뢰하는 것이 불가능해집니다.

CoBRA의 등장: 인간의 결함에 대한 "다이얼"

이 논문의 저자들은 CoBRA(Cognitive Bias Regulator for Social Agents)라는 새로운 툴킷을 만들었습니다. CoBRA는 "고집스럽게 행동하라"와 같은 모호한 지시에 의존하는 대신, 연구자에게 정밀한 다이얼을 제공합니다.

이것은 녹음실의 사운드 믹싱 보드와 같습니다. 음향 엔지니어에게 베이스 소리를 약간 더 "까칠하게" 만들어 달라고 말하는 대신, 단순히 "Bass"라고 적힌 노브를 정확히 2.6으로 돌리는 것입니다. CoBRA는 이 작업을 인간의 사고 오류(인지 편향)에 대해 수행합니다.

그 작동 방식은 다음과 같이 간단한 단계로 나뉩니다.

1. "교정 체육관" (테스트)

다이얼을 돌리기 전에, 먼저 바늘이 어디를 가리키고 있는지 알아야 합니다. CoBRA는 고전적이고 유명한 심리학 실험들(예를 들어, 문제가 어떻게 서술되느냐에 따라 사람들이 다른 선택을 하게 되는 "아시아 질병 문제")을 체육관으로 사용합니다.

  • 테스트: AI는 이러한 심리학 퍼즐을 통과하게 됩니다.
  • 점수: CoBRA는 AI가 그 속임수에 얼마나 "휘둘리는지"를 정확히 측정합니다. 만약 AI가 속임수에 쉽게 넘어간다면, 해당 편향에 대해 높은 점수를 받습니다. 만약 AI가 속임수를 무시한다면, 낮은 점수를 받습니다. 이 점수를 **인지 편향 지수(CBI)**라고 부릅니다.

2. "조절기" (해결책)

CoBRA가 AI의 현재 점수를 파악하면, "행동 조절 엔진"을 사용하여 AI의 두뇌가 연구자가 원하는 정확한 수치에 도달할 때까지 조정합니다.

당신이 AI가 동조 압력(Bandwagon Effect)에 적당히 취약하기를 원한다고 가정해 봅시다. 당신은 다이얼을 2.6으로 설정합니다.

  • 만약 AI가 현재 너무 고집스럽다면(점수 1.0), CoBRA는 AI가 군중을 따를 가능성이 약간 더 높아지도록 내부 설정을 미세하게 조정합니다.
  • 만약 AI가 양떼처럼 행동한다면(점수 4.0), CoBRA는 AI가 더 독립적이 되도록 조정합니다.

논문은 CoBRA가 이 "미세 조정"을 수행하는 세 가지 방법을 보여줍니다:

  • 프롬프트 엔지니어링 (Prompt Engineering): AI에게 매우 구체적이고 수학에 기반한 지시를 내립니다 (예: "군중을 따르는 편향의 60%를 가지고 행동하라").
  • 표상 공학 (Representation Engineering): AI의 내부 "사고 과정"(숨겨진 뇌 상태)을 올바른 방향으로 부드럽게 유도합니다. 마치 자동차가 주행하는 동안 핸들을 조종하는 것과 같습니다.
  • 미세 조정 (Fine-Tuning): 특정 행동을 영구적으로 학습할 수 있도록 AI에게 작고 집중적인 레슨을 제공합니다.

3. 결과: 예측 가능한 배우들

연구진은 이를 테스트하기 위해 "경제학자" 에이전트와 "일반인" 에이전트를 만들었습니다.

  • CoBRA 없이: 기존 방식(단순히 "당신은 경제학자입니다"라고 말하는 방식)을 사용했을 때, 서로 다른 AI 모델들은 완전히 다르게 행동했습니다. 어떤 경제학자는 잘 속았고, 어떤 경제학자는 똑똑했습니다. 이는 엉망이었습니다.
  • CoBRA와 함께: 다이얼을 사용하여 특정 편향 수준을 설정했을 때, 브랜드나 크기에 관계없이 모든 AI 모델은 정확히 똑같이 행동했습니다. 만약 "프레이밍 효과(Framing Effect)" 다이얼을 높게 설정했다면, AI는 매번 일관되게 그 속임수에 넘어갔습니다.

이것이 왜 중요한가 (논문에 따르면)

저자들은 이것이 두 가지 큰 문제를 해결한다고 주장합니다:

  1. 재현성 (Reproducibility): 만약 당신이 다른 연구자에게 "나는 편향 다이얼을 2.6으로 설정했다"라고 말한다면, 그들은 서로 다른 AI 모델을 사용하더라도 정확히 똑같은 결과를 얻을 수 있습니다. 이는 "소리를 크게 해줘"라고 말하는 대신 "볼륨을 50%로 올려줘"라고 말하는 것과 같습니다.
  2. 제어 (Control): 이제 연구자들은 "사람들이 약간 편향되었을 때 어떤 일이 일어나는지" 또는 "사람들이 극도로 편향되었을 때 어떤 일이 일어나는지"를 말할 수 있으며, 이를 수학적 정밀도로 수행할 수 있습니다.

요약하자면:
CoBRA는 AI "연기"의 혼란스럽고 예측 불가능한 세계를 정밀한 과학으로 바꿉니다. 이는 모호한 역할극 지시를 정밀하게 교정된 제어판으로 대체하여, 연구자들이 수학적 정밀도로 볼륨 노브를 돌리는 것과 같은 신뢰성을 가지고 특정 인간의 사고 오류를 AI 에이전트에 프로그래밍할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →