← 최신 논문
🤖 AI

When Agents Disagree With Themselves: Behavioral Consistency as an Uncertainty Signal for LLM Agents

이 논문은 LLM 에이전트의 행동 시퀀스에 나타나는 행동적 분산이 별도의 훈련 없이도 불확실성 신호 역할을 수행하여, 별도의 홀드아웃 교정 데이터 없이도 정확도와 모델 순위 신뢰도를 크게 향상시키는 선택적 분류 및 분포 불가지론적 교정을 가능하게 함을 입증한다.

원저자: Aman Mehta

게시일 2026-07-16
📖 5 분 읽기🧠 심층 분석

원저자: Aman Mehta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 더블 체크: 왜 AI에게 한 번이 아니라 두 번 물어보는 것이 더 나을 수 있는가

당신이 복잡한 수수께끼나 수학 문제와 같은 까다로운 퍼즐을 풀려고 노력하고 있다고 상상해 보세요. 만약 친구에게 답을 물어본다면, 그 친구는 정답을 맞힐 수도 있고, 추측하다가 틀릴 수도 있습니다. 하지만 만약 그 똑같은 친구에게 똑같은 질문을 연속으로 열 번 던질 수 있다면 어떨까요? 만약 그 친구가 매번 똑같은 답을 준다면, 당신은 아마도 그 답이 맞을 것이라고 꽤 확신하게 될 것입니다. 반대로, 만약 그 친구가 열 가지 서로 다른 답을 내놓는다면, 당신은 무언가 잘못되었다는 것을 알게 됩니다. 친구가 혼란스러워하거나, 추측하고 있거나, 혹은 질문이 너무 어려운 것입니다.

이것이 바로 오늘날의 AI 에이전트를 구동하는 초지능형 컴퓨터 프로그램인 **대규모 언어 모델(LLM)**의 핵심 아이디어입니다. 이러한 에이전트들은 웹 검색이나 코드 작성과 같은 도구를 사용하여 다단계 문제를 해결할 수 있는 디지털 탐정과 같습니다. 하지만 인간과 마찬가지로, 이들도 완벽하지 않습니다. 때때로 환각 현상(내용을 지어내는 것)을 보이거나 루프에 빠지기도 합니다. 과학자들은 오랫동안 고민해 왔습니다. 단순히 AI에게 "확실해?"라고 묻지 않고도(왜냐하면 AI는 자신이 확실하다고 거짓말을 할 수 있기 때문입니다), 어떻게 AI가 스스로 확신하지 못하는지 알 수 있을까? 이 논문은 영리한 트릭을 탐구합니다. 단 하나의 답변을 신뢰하는 대신, AI가 동일한 작업을 반복해서 수행할 때 어떻게 행동하는지를 관찰하는 것입니다. 만약 AI의 행동이 갈팡질팡한다면, 그것은 답이 틀렸을 수도 있다는 거대한 적신호입니다.

AI 에이전트가 스스로 결정하지 못할 때

이 연구를 진행한 연구진은 단순하지만 강력한 아이디어인 **행동 일관성(Behavioral Consistency)**을 테스트하기로 했습니다. 그들은 AI 에이전트를 시험을 치르는 학생처럼 취급했습니다. 단순히 최종 정답만을 채점하는 대신, 학생이 문제를 어떻게 푸는지 관찰했습니다. 그들은 동일한 AI 에이전트에게 동일한 질문을 각각 10번씩 실행하게 했으며, 이때 서로 다른 "랜덤 시드(random seed)"를 사용했습니다(이는 AI가 결정을 내릴 때 뽑는 카드의 덱을 섞는 것과 같습니다).

연구 결과는 다음과 같으며, 이는 다소 놀랍습니다:

1. AI는 변덕스러운 사고가이다
설령 당신이 AI에게 정확히 같은 지시를 내리고 같은 시작점을 제공하더라도, AI는 항상 똑같은 방식으로 생각하지는 않습니다. 테스트에서 동일한 에이전트를 10번 실행했을 때, 솔루션에 도달하는 경로는 2.3개에서 4.2개 사이의 서로 다른 경로가 나타났습니다. 때때로 AI는 지름길을 택하기도 하고, 때로는 길고 혼란스러운 골목길을 헤매기도 합니다. 이 "헤맴"은 단순한 오류가 아닙니다. 이것은 하나의 신호입니다. AI가 문제를 해결하는 '방법'에 대해 마음을 더 많이 바꿀수록, 정답을 맞힐 확률은 낮아집니다.

2. 일관성은 정확성을 보여주는 수정구슬이다
연구팀은 AI의 일관성과 정확성 사이에 강력한 연관성이 있음을 발견했습니다.

  • "안정적인" 그룹: AI가 동일한 경로를 고수했을 때(고유 경로가 2개 이하일 때), 정답률은 82%에서 87% 사이였습니다.
  • "헤매는" 그룹: AI가 많은 방향으로 방황했을 때(고유 경로가 4개 이상일 때), 정확도는 41%에서 65% 사이로 떨어졌습니다.

이 격차는 매우 컸습니다. 즉, 만약 당신이 AI에게 질문할 때마다 AI가 매우 다른 경로를 택하는 것을 본다면, 그 답변을 덜 신뢰해야 한다는 뜻입니다.

3. "2단계"의 놀라움
연구진은 AI가 언제부터 혼란을 느끼기 시작하는지 면밀히 살펴보았습니다. 그들은 특정 모델(Llama 등)의 경우, 문제가 거의 즉시 발생한다는 것을 발견했습니다. 약 **50.5%**의 경우, AI는 다른 시도들과 비교했을 때 첫 번째 또는 두 번째 단계에서 다른 단계를 밟았습니다. 이는 마치 AI가 갈림길에 서서 어느 쪽으로 가야 할지 결정하지 못하는 것과 같습니다. 반면 다른 모델(Claude 등)은 경로가 갈라지기 전까지 훨씬 더 오래 동일한 경로를 유지했습니다.

4. "필터" vs "투표자"
이 정보를 사용하는 방법에 대한 가장 흥리학적인 발견 중 하나였습니다.

  • "투표자(Voter)" 접근법: 당신은 "AI에게 3번 물어보고 다수결로 결정하면 더 나은 답을 얻을 수 있지 않을까?"라고 생각할 수 있습니다. 논문에 따르면 이 방법은 효과가 있긴 하지만 아주 조금뿐입니다(정확도를 겨우 0~2% 향상시킴). 왜 그럴까요? 때때로 AI는 자신 있게 틀리기 때문입니다. 만약 초기에 실수를 한다면, 매번 똑같은 실수를 할 수 있으며, 이 경우 "투표"는 그 오류를 확인해 줄 뿐입니다.
  • "필터(Filter)" 접근법: 연구진은 투표 대신 다른 전략을 시도했습니다. 바로 AI가 스스로와 일치할 때만 답하는 것입니다. 그들은 "만약 AI가 작업을 3번 실행했는데 3번 모두 정확히 같은 답을 낸다면, 그 답을 수용한다. 만약 서로 다르다면, '모르겠다'고 말하고 질문을 건너뛴다"라고 설정했습니다.
    • 이 "필터" 방식은 놀라운 성과를 냈습니다. 불확실한 질문들을 건너뜀으로써, AI가 실제로 답한 질문들에 대한 정확도는 **8788%**로 급증했습니다. 이는 단 한 번의 추측을 할 때보다 **614 퍼센트 포인트**나 향상된 수치입니다!

5. "질문하기"보다 낫다
연구팀은 이 "행동 일관성" 트릭을 AI에게 "얼마나 자신 있니?"라고 묻는 것(이를 "언어적 확신"이라 부릅니다)과 비교했습니다. 결과는 명확했습니다. AI의 행동은 그 말보다 훨씬 더 뛰어난 거짓말 탐지기였습니다. AI는 갈팡질팡하며 원을 그리며 헤매고 있을 때도 자신이 자신 있다고 말하곤 했습니다. 행동적 신호(AI가 마음을 바꾸는지 관찰하는 것)가 실수를 포착하는 훨씬 더 신뢰할 수 있는 방법이었습니다.

6. 어디에서나 작동한다
이것이 특정 유형의 질문에만 국한된 우연이 아님을 확인하기 위해, 연구진은 완전히 다른 종류의 작업인 컴퓨터 코드의 버그를 수정하는 작업(SWE-bench라는 벤치마크 사용)을 테스트했습니다. 코딩은 질문 답변과는 매우 다르지만, 동일한 규칙이 적용되었습니다. 행동이 가장 일관적이었던 AI가 또한 가장 정확했습니다. "일관성 계층 구조"(어떤 모델이 안정적이고 어떤 모델이 흔들리는지)는 두 테스트 모두에서 동일하게 유지되었습니다.

이것이 중요한 이유

이 논문은 우리가 AI를 더 신뢰할 수 있게 만들기 위해 AI의 뇌를 바꾸거나 새로운 것을 가르칠 필요가 없다고 제안합니다. 우리는 그저 AI를 관찰하기만 하면 됩니다. 작업을 몇 번 실행하고 AI의 "이야기"가 동일하게 유지되는지 확인함으로써, 우리는 스마트한 편집자 역할을 할 수 있습니다. 우리는 일관된 답변은 신뢰하고, AI가 혼란스러워 보이는 답변은 무시할 수 있습니다.

이것은 "훈련이 필요 없는(training-free)" 방법으로, 어떤 AI 모델에도 즉시 적용할 수 있습니다. 이는 AI의 불확실성을 유용한 신호로 전환합니다. 단 하나의 답변을 맹목적으로 믿는 대신, 우리는 이 "일관성 체크"를 통해 "이 부분은 잘 모르겠다"라고 말할 때를 알 수 있습니다. 이는 AI 에이전트를 현실 세계에서 더 안전하고 신뢰할 수 있게 만드는 데 있어 큰 진전입니다.

요약하자면: 만약 AI가 스스로 계획을 결정하지 못한다면, 그 답을 믿기에 적절한 때가 아닐 가능성이 높습니다. 하지만 매번 똑같은 계획을 고수한다면, 당신은 그 AI가 올바른 길 위에 있다고 확신해도 좋습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →