← 최신 논문
🤖 AI

Does a Tool Result Carry More Authority Than Plain Text? Three Prospective Studies of False-Claim Adoption in a Synthetic Assignment Task with Claude Opus 5

Claude Opus 5에 관한 세 건의 전향적 연구는 도구-결과 메타데이터가 일반적인 단언에 비해 초기에는 허위 주장 채택을 증가시키는 것으로 보였으나, 이후의 사전 등록된 복제 연구들은 이러한 효과가 일관되지 않았으며 명시적으로 공지된 인라인 텍스트의 영향보다 우월하지도 않다는 것을 입증했다.

원저자: Justin Bronder

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Justin Bronder

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능의 세계에서, 언어 모델로 알려진 컴퓨터 프로그램은 무언가를 기억하고, 정보를 찾아보고, 스스로를 위해 노트를 작성할 수 있는 에이전트로서 점점 더 많은 역할을 수행하고 있습니다. 자신의 업무 일지를 기록하는 디지털 비서를 상상해 보십시오. 이 비서는 이전에 자신이 썼던 노트를 읽고, 그 노트를 사실로 취급하며, 나중에 그에 근거해 결정을 내릴 수도 있습니다. 자신이 기록한 곳으로부터 정보를 읽어오는 이 능력은 독특한 루프를 생성합니다. 즉, 증거 없이 단순히 적어 내려간 주장이 나중에 검증된 기록처럼 돌아올 수 있다는 것입니다. 연구자들이 현재 던지는 질문은 정보가 어떻게 포장되느냐에 따라 컴퓨터가 이를 처리하는 방식이 달라지는가 하는 점입니다. 데이터 검색을 위해 사용되는 특정 디지털 형식인 공식적이고 구조화된 '도구 결과(tool result)' 안에 담긴 노트가, 동일한 노트가 일반 텍스트로 전달될 때보다 더 큰 무게감을 갖게 될까요? 만약 형식 그 자체만으로 컴퓨터가 거짓 주장을 더 믿게 만든다면, 이는 시스템이 실제 증거보다는 권위의 외양에 속아 넘어갈 수 있음을 시사합니다.

이를 조사하기 위해, 저스틴 브론더(Justin Bronder)라는 연구자는 클로드 오퍼스 5(Claude Opus 5)라고 불리는 특정 버전의 AI 모델을 사용하여 일련의 통제된 실험을 설계했습니다. 목표는 모델이 특정 형식을 이유로 거짓 정보를 채택하는지 확인하는 것이었습니다. 설정된 작업은 모델에게 특정 항목의 코드를 식별하도록 요청하는 합성 작업이었습니다. 정답 코드는 모델로부터 숨겨져 있었지만, 틀린 코드가 대화 기록 속에 몰래 심어져 있었습니다. 모델은 잘못된 코드, 다른 정답 코드, 또는 모른다고 인정하는 것 중 하나를 선택해야 했습니다. 연구자는 만약 틀린 코드가 '도구 결과' 형식으로 나타날 때와 어시스턴트의 단순한 문장으로 나타날 때를 비교하여, 모델이 심어진 틀린 코드를 맹목적으로 받아들이는지 테스트했습니다.

첫 번째 단계의 연구에서, 모델은 이전의 어시스턴트가 주장한 내용과 별도의 '도구 결과'에 기록된 내용을 보여주는 이력을 제시받았습니다. 틀린 코드가 어시스턴트의 평문 진술에 나타났을 때, 모델은 거의 전혀 이를 받아들이지 않았습니다. 모델은 거짓 정보를 올바르게 무시하거나 모른다고 인정했습니다. 그러나 동일한 틀린 코드가 구조화된 도구 결과 안에 나타났을 때, 모델은 24번의 시도 중 14번에서 이를 사실로 받아들였습니다. 이 초기 결과는 도구 결과 형식이 평문이 갖지 못한 특별한 종류의 권위를 가질 수 있음을 시사했습니다. 모델은 구조화된 기록을 단순한 오류가 아닌, 검증된 조회 결과로 취급하는 것처럼 보였습니다.

이것이 우연이 아님을 확실히 하기 위해, 연구자는 두 번째의 엄격하게 계획된 실험에서 비교를 반복했습니다. 이번에도 모델은 어시스턴트의 텍스트에서 나온 거짓 주장은 무시했지만, 도구 결과 형식에서는 24번 중 7번의 경우에 거짓 주장을 받아들였습니다. 이는 차이가 실재하며 특정 조건 하에서 재현 가능하다는 것을 확인해주었습니다. 도구 결과 패키지는 평문 주장보다 모델의 의사결정에 더 강한 영향력을 미치는 듯했습니다.

하지만 이야기는 세 번째이자 마지막 연구에서 중대한 전환점을 맞이했습니다. 연구자는 이전의 테스트들이 평문과 도구 결과가 서로 다른 방식으로, 서로 다른 시점에 제시되었기 때문에 불공정했을 수 있다는 점을 깨달았습니다. 이 새로운 설정에서, 모델은 사전에 두 개의 기록, 즉 하나는 도구 결과 형식으로, 하나는 평문으로 보게 될 것이라는 안내를 받았습니다. 그리고 두 기록은 최종 질문에서 함께 제시되었습니다. 연구자는 틀린 코드가 들어있는 기록을 서로 바꾸어 놓았습니다. 틀린 코드가 평문에 있을 때, 모델은 60번의 시도 모두에서 이를 받아들였습니다, 즉 60번 중 60번 모두였습니다. 반면 틀린 코드가 도구 결과에 있을 때, 모델은 60번 중 57번을 받아들였습니다.

이 최종 결과는 도구 결과 형식이 본질적으로 더 강력하다는 초기 아이디어를 뒤집었습니다. 이는 모델이 두 기록을 모두 명시적으로 보게 될 때, 평문이 도구 결과만큼이나 설득력이 있다는 것을 보여주었습니다. 이전의 차이는 도구 결과 형식이 마법 같은 권위를 가졌기 때문이 아니라, 첫 번째와 두 번째 연구에서의 정보 제시 방식이 도구 결과를 유일한 유효한 답처럼 보이게 만들었기 때문이었습니다. 모델은 정보의 출처를 판단하기보다는 작업 구조의 지침을 따르고 있었던 것입니다.

연구는 모델이 "도구 결과는 항상 참이다"라는 내장된 규칙을 가지고 있는 것이 아니라고 결론짓습니다. 대신, 모델은 작업이 어떻게 프레이밍되는지에 민감합니다. 만약 작업이 도구 결과가 기대되는 답변인 '조회' 작업처럼 보인다면, 모델은 그 형식을 신뢰할 것입니다. 만약 작업이 두 옵션을 나란히 제시한다면, 모델은 그것들을 동등하게 취급하며, 정보가 도구 결과에 있든 평문에 있든 상관없이 거짓 정보를 믿게 됩니다. 이 연구 결과는 이러한 시스템에서 거짓 정보의 위험성이 정보가 도착하는 형식뿐만 아니라, 전체 대화가 모델로 하여금 그 정보를 신뢰할 이유를 느끼도록 어떻게 구조화되어 있는지에 달려 있음을 강조합니다. 검증된 기록의 외양이 단순히 패키징을 바꿈으로써 만들어질 수 있지만, 모델에게 직접적인 비교를 요구할 때 이 효과가 사라진다는 점을 이 연구는 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →