← 최신 논문
💻 computer science

Dialogical Epistemic Auditing: Tracing Inferential Commitments Across Conversational Turns in Large Language Models

이 논문은 대규모 언어 모델이 대화의 턴을 거치며 자신의 추론적 확언을 어떻게 유지하거나 변경하는지를 추적하기 위한 질적 프레임워크인 "대화적 인식론적 감사(dialogical epistemic auditing)"를 제 제안하며, 사례 연구를 통해 모델들이 사실적 주장은 철회하면서도 입증되지 않은 서사는 보존하는 비대칭적 일관성을 흔히 보인다는 점을 입증한다.

원저자: Giulio Vidotto

게시일 2026-09-04
📖 5 분 읽기🧠 심층 분석

원저자: Giulio Vidotto

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

우리가 컴퓨터에게 복잡한 사건에 대해 설명을 요구할 때, 우리는 종-종 첫 번째 답변만으로 그것을 판단하곤 합니다. 만약 응답이 자신감 있게 들리고 기본적인 사실들을 제대로 짚어낸다면, 우리는 그 기계가 신뢰할 수 있다고 가정하는 경향이 있습니다. 하지만 현실 세계에서 대화는 좀처럼 첫 문장에서 멈추지 않습니다. 우리는 설명을 요구하고, 가정을 반박하며, 어떤 양보로부터 파생되는 결과에 대해 더 깊이 파고듭니다. 기계는 완벽한 기조 연설을 내놓을 수는 있지만, 토론이 깊어짐에 따라 자신의 논리를 일관되게 유지하는 데는 실패할 수 있습니다. 이러한 간극은 거대 언어 모델이 고립된 상태에서 무엇을 말하는가가 아니라, 시간이 흐름에 따라 자신의 주장이 갖는 무게를 어떻게 다루는지에 주목하는 새로운 연구의 초점입니다. 이 연구는 두 아이디어가 충돌할 때 느끼는 정신적 불편함을 설명하는 인간 심리학의 개념인 '인지 부조화'에서 착안했습니다. 사람들은 이 불편함을 줄이기 위해 사실에 맞춰 자신의 신념을 바꾸거나, 자신의 신념에 맞추기 위해 사실을 왜곡하기도 합니다. 이 연구는 인공지능 시스템이 어렵고 모순적인 상황을 설명하도록 압박받을 때도 이와 유사한 패턴을 보이는지 묻습니다.

파두아 대학교의 연구자 줄리오 비도토(Giulio Vidotto)는 2026년 러시아와 우크라이나 사이의 병사 시신 교환이라는 구체적인 실제 사건에 관한 세 가지 서로 다른 인공지능 시스템과의 개별 대화를 통해 이를 테스트하고자 했습니다. 데이터는 극명하고 잘 기록되어 있었습니다. 세 차례의 별도 이송 과정에서 러시아는 매번 약 1,000구의 우크라이나 시신을 돌려받은 반면, 러시아 측은 약 30~40구의 시신만을 받았습니다. 약 25 대 1이라는 이 비율은 하나의 수수께끼를 만들어냈습니다. 숫자는 공개되었고 검증되었지만, 이는 전쟁에서 누가 더 많은 병사를 잃고 있는지에 대한 흔히 알려진 무언의 그림과 모순되는 것처럼 보였습니다. 연구자는 각 시스템에 이 불균형을 설명하도록 요청했습니다. 그는 단순히 요약을 요구한 것이 아니라, 그들의 추론을 명확히 하고, 논리를 반박하며, 결론이 스스로 모순될 때 재고하도록 압박했습니다. 목표는 대화가 진행되는 과정을 차례대로 추적하며, 기계가 논리를 견고하게 유지하는지, 아니면 모순의 불편함을 피하기 위해 조용히 입장을 바꾸는지 관찰하는 것이었습니다.

이 연구는 '대화적 인식 감사(dialogical epistemic auditing)'라고 불리는 방법을 도입했습니다. 연구자는 기계의 코드 내부에서 무엇을 '생각'하는지 추측하는 대신, 대화를 공적인 기록으로 취급했습니다. 그는 기계가 한 모든 주장을 지도화하고, 그 주장이 논증에서 어떤 역할을 하는지 기록했습니다. 그것은 증거였는가? 가설이었는가? 아니면 결론이었는가? 그런 다음 대화가 계속됨에 따라 기계가 그 역할들을 일관되게 유지하는지 관찰했습니다. 잠정적인 추측을 나중에 확고한 사실로 취급했는가? 이유를 설명하지 않고 결론을 포기했는가? 이 감사는 특정한 종류의 실패를 찾아냈습니다. 즉, 기계가 마음을 바꿨음에도 불구하고 그 변화에 맞춰 나머지 이야기를 업데이트하는 데 실패하는 경우를 말합니다. 이는 마치 자신이 시간을 잘못 알았음을 인정하면서도, 여전히 올바른 일정대로 행동하며 남은 계획을 혼란 상태로 남겨두는 사람과 같습니다.

세 차례의 대화 전반에 걸쳐 명확한 패턴이 나타났습니다. 모든 경우에서 인공지능 시스템은 동일한 긴장 관계와 씨름했습니다. 검증된 숫자들은 양측의 사상 규모에 대한 무언의 가정과 충돌했습니다. 이 긴장을 해결하기 위해, 시스템들은 무언의 가정을 의심하기보다 숫자의 의미를 바꾸려고 반복적으로 시도했습니다. 한 대화에서 시스템은 처음에 두 가지 상반된 설명을 마치 둘 다 타당한 것처럼 제시하며 허위 균형을 만들었습니다. 도전을 받자 스스로를 수정했지만, 그다음 차례에서 그 수정을 놓쳐버려 논리에 공백을 남겼습니다. 또 다른 사례에서는 시스템이 특정 설명을 고집했지만, 증거를 요구받자 그 주장을 뒷받받하기 위해 사용하는 증거를 계속해서 바꾸었으며, 결국 오래되고 관련 없는 사실들로 새로운 사실들을 대체했습니다. 세 번째 사례에서 시스템은 방금 설명한 전체 타임라인이 일어나지 않았다고 주장하기까지 했으며, 증거가 명확하고 동시대적인 사건임에도 불구하고 검증된 사실들을 마치 환각인 것처럼 철회했습니다.

가장 눈에 띄는 점은 시스템이 논쟁의 양측을 다루는 방식이었습니다. 실제 검증된 숫자들은 끊임없이 재분류되고, 의심받고, 재해석되었습니다. 숫자들은 직접적인 지표, 제한 사항, 인위적인 데이터, 그리고 마지막에는 영토 통제의 척치로 불렸습니다. 그러나 무언의 상대적 손실에 대한 그림은 결코 의심받지 않았습니다. 그것은 손대지 않은 채 그대로 남았고, 분류되지도 도전받지도 않았습니다. 시스템들은 알려진 사실을 알려진 그림에 맞추기보다, 알려진 그림에 맞추기 위해 알려진 사실을 지속적으로 구부렸습니다. 이러한 행동은 마음이 새로운 정보의 해석을 변경함으로써 핵심 신념을 보호하는 심리학적 개념인 인지 부조화를 반영했습니다. 기계들이 전통적인 의미에서 거짓말을 하는 것은 아니었습니다. 데이터를 허공에서 조작해내는 것도 아니었습니다. 대신, 그들은 모순을 없애기 위해 사실들 사이의 논리적 연결을 재배열했으며, 그 과정에서 종종 자신의 논증을 불안정하고 내부적으로 일관되지 않게 만들었습니다.

연구는 이러한 실패가 단순한 무작위 오류가 아님을 발견했습니다. 그것들은 특정한 궤적을 따랐습니다. 시스템들은 종종 그럴듯한 설명을 시작하지만, 압박을 받으면 숫자를 조정하기 위한 새로운 메커니즘을 도입합니다. 그 메커니즘이 도전받으면 다시 변화하며, 때로는 논리를 복구하고, 때로는 완전히 포기합니다. 한 사례에서는 시스템이 자신의 오류를 인정하고 이를 고치려 노력했지만, 그 복구는 불완전하여 나중에 다시 나타나는 숨겨진 모순을 남겼습니다. 또 다른 사례에서는 시스템이 균형을 찾으려는 자신의 경향을 탓하며 자가 진단을 내렸으나, 기록을 보면 불안정성은 사용자의 질문이 아니라 기계 자체에 의해 생성되었습니다. 세 경우 모두 사용자는 단지 명확성을 요구하거나 논리에 이의를 제기했을 뿐, 잘못된 전제나 오도하는 정보를 제공하지 않았습니다. 불안정성은 전적으로 기계 자신의 응답 내부에서 기원했습니다.

이 연구는 이러한 시스템을 평가할 때 첫 번째 답변만을 보는 것은 불충분하다고 결론짓습니다. 기계는 근저의 논증이 무너지고 있는 동안에도 유창하고 자신감 있게 들릴 수 있습니다. 이 연구는 우리가 이러한 시스템이 긴 대화의 압박을 어떻게 견뎌내는지 지켜봐야 한다고 제안합니다. 그들은 자신의 논리적 약속을 지키는가, 아니면 표류하는가? 연구 결과는 어려운 모순에 직면했을 때, 이 시스템들이 보이는 사실의 의미를 뒤틀어 무언의 가정을 보호하는 경향이 있음을 보여줍니다. 그들은 도전받을 때 붙잡을 수 있는 안정적인 내부 세계관을 가지고 있지 않은 듯합니다. 대신, 그들은 실시간으로 자신의 논증을 재구성하며, 그 과정에서 종종 자신의 논리의 맥락을 놓치곤 합니다.

이것이 기계가 추론 능력이 없다는 것을 의미하는 것은 아니지만, 그들의 추론이 취약하다는 것을 의미합니다. 이 연구는 특정한 취약성을 강조합니다: 대화이 복잡해질 때 일관된 주장의 구조를 유지하지 못하는 능력입니다. 연구자는 이것이 기계가 '나쁘거나' '기만적'이기 때문이 아니라, 정보를 처리하는 방식의 구조적 문제라고 언급합니다. 그들은 대화에서 마찰을 줄이고 도움이 되도록 설계되었는데, 이것이 때때로 논증의 논리를 깨뜨리는 방식으로 모순을 매끄럽게 메워버리는 결과를 초래합니다. 이 연구는 이러한 현상이 모든 대화나 모든 시스템에서 발생하는지는 단정 짓지 않는데, 이는 오직 세 가지 특정 대화만을 조사했기 때문입니다. 그러나 이 연구는 이러한 상호작용을 바라보는 새로운 시각을 제공하며, 인공지능의 진정한 시험은 단순히 무엇을 말하느냐가 아니라, 대화가 힘들어질 때 자신이 말한 것을 어떻게 유지하느냐에 달려 있음을 보여줍니다. 연구 결과는 숫자가 이야기를 들려주게 두는 대신, 숫자를 끼워 맞추기 위해 기계가 조용히 게임의 규칙을 바꾸고 있는 순간을 포착하는 법을 배우는 것이 복잡한 설명을 위해 이러한 도구에 의존하는 사용자들에게 가장 중요한 기술이 될 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →