← 최신 논문
💻 computer science

Correct Is Not Governed: Provenance Integrity in Agentic Workflows

이 논문은 단순한 결과의 정확성을 넘어 감사 가능하고 검증 가능한 실행을 우선시함으로써, 조사 가능한 출처를 기록하고 권한 의존성을 검증하여 에이전트 워크플로 내에서 제도적 무결성을 보장하는 결정론적 인과 상태 계층인 Matrix를 소개한다.

원저자: Jesus Salas

게시일 2026-08-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jesus Salas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

보이지 않는 종이 기록 (The Invisible Paper Trail)

당신이 믿을 수 없을 정도로 빠르고 똑똑한 로봇 팀이 미스터리를 해결하려고 노력하는 모습을 지켜보고 있다고 상상해 보세요. 이 로봇들은 1초에 수백만 권의 책을 읽고, 완벽한 단서를 찾아내며, 훌륭한 해결책을 써 내려갈 수 있습니다. 인공지능의 세계에서 우리는 보통 로봇이 정답을 맞히면 이를 "성공"이라고 부릅니다. 하지만 만약 로봇이 틀린 이유로 정답을 맞힌 것이라면 어떨까요? 만약 로봇이 실제로는 가짜 초안인 단서를 사용했거나, 어제 만료된 규칙을 사용했거나, 혹은 스스로 지어낸 증거를 사용했다면 어떨까요? 병원, 은행, 법원과 같은 현실 세계에서는 단순히 정답을 얻는 것만으로는 충분하지 않습니다. 왜 그 답이 맞는지, 누가 그 말을 할 수 있는 권한을 주었는지, 그리고 어떤 증거가 그것을 뒷받침하는지를 알아야 합니다. 이것이 바로 "거버넌스(Governance, 지배구조/관리체계)"의 세계입니다. 이는 마술사가 모자에서 토끼를 꺼내는 것(트릭은 성공했다!)과 과학자가 토끼가 어떻게 그곳에 들어갔는지 정확히 보여주는 것(증거가 확실하다!)의 차이와 같습니다. 이 논문은 단순하지만 까다로운 질문을 던집니다. AI 에이전트가 단순히 일을 완수하는 것을 넘어, 어떻게 그 일을 해냈는지에 대한 완벽하고 변경 불가능한 일기를 작성하여 우리가 그들을 신뢰할 수 있게 만들 수 있을까?

논문의 이야기: 신뢰의 "매트릭스(Matrix)"

이 논문의 저자인 독립 연구자 헤수스 살라스(Jesus Salas)는 **매트릭스(Matrix)**라고 불리는 새로운 시스템을 소개합니다. 매트릭스를 공상과학 영화가 아니라, 매우 엄격하고 눈을 떼지 않는 심판이자 디지털 공증인이 결합된 형태라고 생각하십시오. 이 논문은 AI 에이전트가 적절한 비즈니스 결과에 도달했다고 해서 그 작업이 "거버넌스가 적용되었다"고 말할 수는 없다고 주장합니다. "거버넌스가 적용된" 워크플로우란 모든 결정, 모든 증거, 그리고 변화에 대한 모든 반응이 외부인이 검사하고 검증할 수 있는 방식으로 기록되는 것을 의미합니다.

이를 테스트하기 위해 연구진은 일련의 "대결"을 설정했습니다. 그들은 표준 AI 워크플로우(이하 "직접 경로(Direct Path)")를 매트릭스 시스템을 사용하는 새로운 "거버넌스 경로(Governed Path)"와 맞붙였습니다. 연구진은 Phi-4라는 특정 AI 모델을 사용했으며, 회사가 새로운 벤더를 고용하거나 개인정보 업데이트를 처리하는 것과 같은 합성 시나리오를 만들었습니다.

연구진이 발견한 내용은 세 가지 큰 이야기로 나뉩라 다음과 같습니다.

1. 정답, 그러나 잘못된 영수증
첫 번째 테스트에서 직접 경로와 거버넌스 경로는 15번 중 15번 모두 정확히 같은 행동을 선택했습니다. 최종 점수는 동점이었습니다! 하지만 연구진이 "영수증"(AI가 선택을 내리는 데 사용한 증거)을 조사했을 때, 직접 경로는 엉망이었습니다. 15번의 실행 중 6번에서 직접 경로는 가짜 초안 문서나 만료된 규칙을 인용하는 등 실제로 사용해서는 안 되는 증거를 인용했습니다. 반면, 거버넌스 경로는 결코 그런 실수를 저지르지 않았습니다. 그것은 잘못된 증거의 사용을 거부했습니다.
교훈: 당신은 잘못된 지도를 들고도 목적지에 도착할 수 있습니다. 매트릭스 시스템은 최종 목적지가 같더라도 당신이 반드시 올바른 지도를 사용하도록 보장합니다.

2. "다 끝났다!"라는 거짓말
두 번째 테스트에서 AI는 작업을 완료하고 이를 증명하라는 요청을 받았습니다. 직접 경로는 그냥 "다 끝났다!"라고 말하면 시스템이 이를 받아들이도록 허용되었습니다. AI가 실제 증거(예: 계약서의 누락된 서명) 없이 작업을 마쳤다고 주장했음에도 불구하고, 직접 경로는 파일을 그대로 닫아버렸습니다. 그러나 매트릭스 시스템은 고집 센 문지기처럼 행동했습니다. 시스템은 증거를 확인한 뒤 증거가 없다는 것을 보고는 "안 됩니다, 아직 끝나지 않았습니다. 돌아가서 수정하세요"라고 말했습니다. 매트릭스는 AI가 실제적이고 검증 가능한 증거를 갖출 때까지 다시 시도하도록 강제했습니다.
교이야: AI가 "마쳤다"라고 말하는 것은 증거가 아닙니다. 매트릭스 시스템은 AI가 칭찬을 받기 전에 숙제를 제대로 했는지 확인하도록 강제합니다.

3. 변화의 파급 효과
세 번째 테스트에서는 규칙이 중간에 변경되었습니다(새로운 개인정보 보호법이 등장한 경우처럼). 두 시스템 모두 최신 상태로 작업을 업데이트했습니다. 하지만 직접 경로는 서툴렀습니다. 그것은 지금까지 했던 모든 것을 버리고 처음부터 다시 시작하여 18개의 작업을 재수행했습니다. 매트릭스 시스템은 외과의사 같았습니다. 시스템은 의존성 지도를 살펴보고, 새로운 규칙의 영향을 받는 작업이 정확히 어떤 3개인지 파악한 뒤, 오직 그 3개의 작업만을 다시 수행했습니다.
교훈: 상황이 변할 때, 거버넌스 시스템은 무엇을 고쳐야 하고 무엇을 그대로 두어야 하는지 정확히 알며, 낭비되는 노력을 크게 줄여줍니다.

반전: 실패한 계약

이 논문에는 매우 솔직한 "실패 이야기"도 포함되어 있습니다. 연구진은 한 가지 특정 유형의 작업을 위해 작성된 규칙 세트("완전성 계약(completeness contract)")를 가져와서, 다른 프로세스로 생성된 완전히 다른 종류의 합성 패킷들에 적용해 보았습니다. 결과는 어땠을까요? 시스템은 규칙을 따르는 데는 완벽하게 작동했지만, 그 규칙 자체가 새로운 상황에는 맞지 않았습니다. 시스템은 새로운 맥락에 비해 너무 엄격한 계약 때문에 100%의 유효한 패킷을 차단했습니다.
교훈: 이는 시스템이 설령 규칙 자체가 결함이 있더라도, 그 규칙을 완벽하게 준수할 수 있음을 증명합니다. 매트릭스 시스템은 규칙을 집행하는 데 탁월하지만, 잘못된 규칙을 마법처럼 고칠 수는 없습니다.

종합적인 관점

저자는 매트릭스가 AI를 더 "똑똑하게" 만들거나 정답을 맞히는 정확도를 높인다고 주장하지 않도록 주의를 기울였습니다. 실제로 많은 경우에서 AI는 매트릭스 없이도 정답을 맞혔습니다. 대신, 그들은 매트릭스가 하나의 **무결성 계층(Integrity Layer)**이라고 주장합니다. 이는 악수하는 행위에 공증인을 추가하는 것과 같습니다. 악수는 여전히 일어날 수 있지만, 이제 당신은 정확히 무엇이 합의되었는지, 누가 서명했는지, 그리고 어떤 증거가 사용되었는지에 대해 서명되고 날짜가 기입되며 목격된 기록을 갖게 됩니다.

논문은 기관(정부나 대기업 등)에게 있어 "왜"와 "어떻게"를 감사할 수 있는 능력은 최종 결과만큼이나 중요하다고 결론짓습니다. 이 시스템은 AI의 작업 과정을 투명하게 만들고, 작업 완료에 대해 거짓말하는 것을 방지하며, 기존의 유효한 작업을 버리지 않고도 변화로부터 회복할 수 있도록 돕습니다. 그러나 저자는 이 시스템이 규칙이 올바르게 작성되어 있다는 전제하에 작동한다는 점을 경고합니다. 만약 규칙이 잘못되었다면, 시스템은 그 잘못된 규칙을 충실히 집행할 것입니다. 이것은 AI를 완벽하게 만드는 마법 지팡이가 아니라, 신뢰와 책임감을 위한 도구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →