← 최신 논문
🤖 machine learning

Honest Lying: Understanding Memory Confabulation in Reflexive Agents

본 논문은 Reflexion 스타일의 에이전트가 부정확한 자기 성찰을 확신에 차서 저장하고 반복적으로 의존하는 '기억 착시'에 시달린다는 점을 드러내며, 개방형 자기 진단을 프로그래밍된 실패 신호로 대체하는 완화 전략을 제안함으로써 이러한 오류율을 크게 낮추고 작업 수행 능력을 향상시킨다고 주장한다.

원저자: Prakhar Dixit, Sadia Kamal, Tim Oates

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Prakhar Dixit, Sadia Kamal, Tim Oates

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

어떤 로봇에게 지저분한 집을 치우도록 가르친다고 상상해 보세요. 당신은 로봇에게 "빨간색 머그잔을 집어서 식기세척기에 넣어라"라고 말합니다. 로봇은 시도하지만 실패하고, 그다음 당신은 "무엇이 잘못되었니?"라고 묻습니다.

로봇은 열심히 생각한 뒤 일기에 메모를 씁니다: "나는 잘못된 물건을 집으려 했기 때문에 실패했다. 더 조심해야 한다."

완벽한 세상이라면 로봇은 다음에 이 메모를 읽고 다시 시도할 것입니다. 하지만 이 논문에서 연구자들은 기이하고 위험한 사실을 발견했습니다: 로봇은 스스로에게 거짓말을 하고 있으며, 그 거짓말을 믿고 있습니다.

이 논문 "정직한 거짓말 (Honest Lying)"이 발견한 내용을 일상적인 비유를 사용해 간단히 설명해 보겠습니다.

1. "고장 난 나침반" 문제

연구자들은 반성 에이전트 (Reflexion Agent) 라는 유형의 AI 에이전트를 연구했습니다. 이 에이전트를 시험을 보는 학생이라고 생각하세요. 만약 그들이 문제를 틀리면, 왜 실패했는지에 대한 "반성 (자신에게 보내는 메모)"을 쓸 수 있습니다. 그런 다음 그들은 시험을 다시 보기 전에 이 메모를 읽습니다.

큰 전제는 다음과 같았습니다: 학생이 실수에 대한 메모를 쓰면, 그로부터 배울 것이다.

이 논문은 그 전제가 종종 틀렸음을 보여줍니다.

  • 상황: 로봇에게 "머그잔 (Mug)"을 찾아달라고 요청합니다.
  • 거짓말: 로봇은 실패한 뒤 과제를 살펴보고 일기에 자신 있게 씁니다: "나는 전자레인지 안에 있는 토마토를 찾으려 했기 때문에 실패했다."
  • 현실: 토마토나 전자레인지란 것은 전혀 없었습니다. 과제는 처음부터 머그잔에 관한 것이었습니다.
  • 결과: 로봇은 이 거짓말을 기억합니다. 그 후 14 번의 시도 동안, 매번 눈앞에 있는 과제 설명 ("머그잔") 을 무시한 채 전자레인지 안의 토마토를 찾으려 합니다.

저자들은 이를 "기억의 망상 (Memory Confabulation)" 이라고 부릅니다. 이는 북쪽이 남쪽이라고 고집하는 고장 난 나침반을 가진 사람과 같습니다. 동쪽에서 해가 뜨는 것을 보여줘도, 그들은 현실보다 고장 난 나침반을 더 신뢰합니다.

2. 왜 이런 일이 발생할까요? ("모호한 피드백" 함정)

로봇은 왜 이런 거짓말을 만들어낼까요? 논문은 나쁜 피드백을 그 원인으로 지적합니다.

비디오 게임을 한다고 상상해 보세요.

  • 좋은 피드백: "너는 너무 높은 벽을 뛰어넘으려 했기 때문에 실패했다." (구체적이고 도움이 됨).
  • 나쁜 피드백: "실패했다." (이분법적이고 모호함).

연구에 참여한 로봇들은 대부분 나쁜 피드백을 받았습니다. 그들은 단순히 "통과" 또는 "실패" 신호만 받았습니다. 로봇이 정확히 어느 단계에서 잘못되었는지 알지 못했기 때문에 추측할 수밖에 없었습니다.

  • 그것은 잘못 추측했습니다.
  • 잘못된 추측을 일기에 적었습니다.
  • 다음 번에 일기를 읽었습니다.
  • 다시 같은 잘못된 것을 추측했습니다.

로봇은 자기 강화되는 거짓말의 고리에 갇히게 되었습니다. 한 번 착각한 것이 아니라, 계속 살아내는 가상의 현실을 구축한 것입니다.

3. "얼어붙은" 기억

연구자들은 약 32% 의 작업에서 로봇의 기억이 "얼어붙었다"는 사실을 발견했습니다.

  • 정상적인 기억: 로봇은 시도하고, 실패하고, 배우고, 전략을 바꿉니다.
  • 얼어붙은 기억: 로봇은 시도하고, 실패하고, 같은 거짓말을 쓰고, 다시 시도하고, 같은 거짓말을 쓰고, 포기할 때까지 이를 반복합니다.

이것을 측정하기 위해 RRR(반성 반복률, Reflection Repetition Rate) 이라는 지표를 만들었습니다. 이는 이전 시험에서 같은 오답을 몇 번이나 복사했는지 확인하는 것과 같습니다. 이 비율이 높으면 로봇은 갇혀 있는 것입니다.

4. 해결책: "왜"를 묻지 말고 "무엇"을 보여주기

연구자들은 이를 해결하려 시도했습니다. 그들은 로봇에게 "자기 진단 (왜 실패했는지 추측)"을 시키는 것이 문제임을 깨달았습니다. 로봇은 그럴듯한 이유를 만들어내는 데 너무 능했습니다.

해결책: 로봇에게 추측하게 하는 대신, 로봇의 행동에서 사실을 직접 추출하는 도구를 프로그래밍했습니다.

  • 옛 방식: 로봇: "나는 너무 느렸기 때문에 실패한 것 같다." (거짓말).
  • 새 방식: 시스템은 로그를 살펴보고 말합니다: "사실 로그에 따르면 당신은 머그잔을 냉장고에 넣으려 했고, 게임은 '아무 일도 일어나지 않음'이라고 답했습니다."

로봇이 추측하게 하는 대신 실패한 구체적인 행동 (실패한 특정 행동) 과 같은 단단한 사실을 로봇에게 제공함으로써, 로봇은 거짓말을 멈췄습니다.

  • 결과: 로봇은 0% 에서 86% 로 올바른 물체 (머그잔) 를 언급하기 시작했습니다.
  • 결과: 이전에 완전히 실패했던 16 개 작업 중 3 개를 해결했습니다.

5. "더 강력한 로봇"이라는 놀라운 사실

연구자들은 더 똑똑한 로봇 (더 진보된 AI 모델) 도 테스트했습니다.

  • 좋은 소식: 더 똑똑한 로봇은 잘못된 물체를 만들어내지 않았습니다. 토마토가 아니라 머그잔을 찾고 있다는 것을 알았습니다.
  • 나쁜 소식: 여전히 어려운 과제를 해결하지는 못했습니다. 단지 다른 방식으로 (예: 잘못된 형식으로 계획을 작성하는 등) 갇히게 되었습니다.

이것은 그들에게 중요한 교훈을 주었습니다: 망상 (거짓말) 과 능력 (기술) 은 두 가지 다른 문제입니다.

  • 거짓말은 (더 나은 사실을 제공함으로써) 고칠 수 있지만, 로봇이 퍼즐을 풀 만큼 똑똑하지 않다면 여전히 실패할 것입니다.
  • 그러나 만약 거짓말을 고치지 않는다면, 로봇은 해결할 수 있었을 퍼즐조차 실패하게 됩니다.

핵심 교훈

이 논문은 자신감 있고 그럴듯한 거짓말을 저장하는 기억 시스템은 아예 기억이 없는 것보다 나쁘다고 결론 내립니다.

실수로부터 학습하는 AI 를 구축한다면, 그 AI 가 단순히 그 실수의 이유를 "만들어내지" 않도록 해야 합니다. 실제로 일어난 일의 원시 데이터를 제공해야 합니다. 그렇지 않으면 AI 는 자신의 거짓된 이야기들을 영원히 믿으며 "정직한 거짓말"의 고리에 갇히게 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →