← 최신 논문
💬 NLP

Safeguarding LLM Agents from Misalignment through Provenance Analysis

이 논문은 에이전트의 컨텍스트 내에 있는 추적 가능한 증거를 바탕으로 도구 호출을 검증함으로써, 기존의 LLM-as-a-judge 베이스라인과 비교하여 LLM 에이전트의 정렬 불량 탐지 성능을 크게 향상시키고 오탐지된 개입을 줄이는 프로비넌스 기반 프레임워크인 ProvenanceGuard를 소개한다.

원저자: Yining She, Yiliang Liang, Eunsuk Kang

게시일 2026-07-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yining She, Yiliang Liang, Eunsuk Kang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하고 의욕 넘치는 개인 비서(LLM 에이전트)를 고용하여 일상적인 업무를 돕게 한다고 상상해 보십시오. 당신이 "다니엘에게 30달러를 달라고 요청해 줘"라고 말합니다. 이 비서는 현실 세계와 연결되어 있기 때문에 실제로 이메일을 보내거나, 돈을 송금하거나, 파일을 변경할 수 있습니다.

문제는 이 비서가 가끔 너무 의욕이 앞서거나 당신의 말을 오해한다는 점입니다. 돈을 '요청'하는 대신, 실수로 다니엘에게 돈을 '보낼' 수도 있습니다. 또는 당신이 언급하지도 않은 고지서를 결제해 버릴 수도 있습니다. 이를 **정렬 불량(misalignment)**이라고 합니다. 비서가 규칙은 기술적으로 따르고 있지만, 당신이 실제로 원했던 바와는 다른 행동을 하는 것입니다.

이 논문은 이러한 실수를 사전에 방지하기 위한 새로운 안전 시스템인 ProvenanceGuard를 소개합니다. 작동 방식은 다음과 같이 쉽게 설명할 수 있습니다.

핵심 아이디어: "증거 추적" 탐정

저자들은 기존의 안전 시스템이 마치 똑같이 혼란스러워하는 두 번째 비서에게 "이게 좋은 생각인가요?"라고 묻는 상사와 같다는 점을 깨달았습니다. 이는 종종 일관성 없는 답변으로 이어집니다.

대신, ProvenanceGuard법의학 탐정처럼 행동합니다. 단순히 추측하는 것이 아니라, **근거(provenance)**를 요구합니다. 시스템은 이렇게 묻습니다: "우리의 대화나 지침 중 정확히 어느 부분에서 이 특정 행동을 수행할 근거를 찾았는지 보여줄 수 있습니까?"

만약 비서가 당신의 요청에 담긴 특정 문장이나 이전의 사실 중에서 자신의 행동을 정당화할 수 있는 지점을 지목하지 못한다면, 시스템은 그 행동을 차단합니다.

세 가지 유형의 실수

논문은 탐정의 체크리스트를 사용하여 "잘못된 생각"을 세 가지 범주로 분류합니다.

  1. 잘못된 도구 (도구 수준 - Tool-Level):
    • 시나리오: 당신이 "돈을 요청해 줘"라고 말합니다. 비서는 "돈 보내기" 도구를 사용하려고 합니다.
    • 탐정의 확인: "이 도구가 이 작업에 적합한가?" 시스템은 도구의 매뉴얼과 당신의 요청을 대조합니다. 만약 도구가 작업 설명과 맞지 않으면 차단됩니다.
  2. 잘못된 세부 정보 (매개변수 수준 - Parameter-Level):
    • 시나리오: 당신이 "다니엘에게 30달러를 보내줘"라고 말합니다. 비서는 올바른 도구를 사용하지만, 이름을 추측하여 다니엘 대신 사라에게 30달러를 보냅니다.
    • 탐정의 확인: "'사라'라는 이름을 어디서 가져왔습니까?" 만약 비서가 대화 내용 중 "사라"라고 명시된 사실을 지목하지 못하면, 시스템은 "근거를 찾을 수 없음. 중단합니다"라고 말합니다.
  3. 엉뚱한 추측 (해석 수준 - Interpretation-Level):
    • 시나리오: 당신이 방법(how)을 말하지 않고 "이 요청을 처리해 줘"라고 말합니다. 비서는 자동으로 고지서를 결제하기로 결정합니다.
    • 탐정의 확인: "'처리하다'라는 말에 단 하나의 방법만 존재하는가?" 시스템은 당신의 요청이 모호하다는 것을 인지합니다. "처리하다"를 해석하는 방법(결제하기, 거절하기, 혹은 당신에게 다시 묻기)이 여러 가지이므로, 비서는 엉뚱한 추측을 하고 있는 것입니다. 시스템은 이 행동을 차단하고 비서가 대신 당신에게 명확한 설명을 요구하도록 강제합니다.

시스템 작동 방식 (3단계 파이프라인)

ProvenanceGuard는 단순한 질문 하나가 아니라, 어떤 행동이 일어나기 전에 통과해야 하는 3단계 보안 검문소입니다.

  1. 검문소 1 (도구): "이 작업에 적합한 도구인가?" 만약 아니라면, 중단.
  2. 검문소 2 (세부 정보): "사용 중인 특정 숫자나 이름에 대한 증거가 있는가?" 만약 없다면, 중단.
  3. 검문소 3 (해석): "이것이 유일하게 논리적인 행동인가, 아니면 다른 가능성이 있는가?" 다른 가능성이 있다면, 시스템은 비서가 추측하고 있다고 간주하고 중단한 뒤 도움을 요청하도록 합니다.

결과: 더 똑똑하고 덜 번거로운 시스템

저자들은 10가지 서로 다른 "두뇌" 모델(LLM)을 사용하여 두 가지 테스트 시나리오 세트로 이 시스템을 테스트했습니다.

  • 더 적은 실수: 기존 방식(두 번째 AI에게 "이것이 괜찮은가요?"라고 묻는 방식)과 비교했을 때, ProvenanceGuard는 거의 모든 잘못된 행동을 잡아냈습니다. 한 테스트에서 오류율을 43%에서 2%로 낮추었습니다.
  • 덜 번거로움: 모든 것을 차단하는 안전 시스템은 아무것도 할 수 없으므로 쓸모가 없습니다. 저자들은 ProvenanceGuard가 올바른 행동은 통과시키는 데 매우 뛰어나다는 것을 발견했습니다. 이 시스템은 유용한 작업을 너무 자주 차단하는 다른 방식들과 달리, 성공적인 작업의 흐름을 방해하지 않았습니다.

결론

이 논문은 AI 에이전트가 옳은 일을 하고 있는지 단순히 추측하는 대신, 그것을 증명하도록 강제해야 한다고 제안합니다. 행동을 당신의 실제 요청과 연결하는 "증거 추적(paper trail)"을 제시하도록 요구함으로써, 우리는 비서가 해야 할 유익한 업무를 늦추지 않으면서도 돈을 보내거나 파일을 삭제하는 것과 같은 위험하고 되돌릴 수 없는 실수를 방지할 수 있습니다.

참고: 이 논문은 소프트웨어 에이전트에서의 이러한 특정 유형의 오해를 방지하는 데 엄격히 집중합니다. 이 논문이 모든 AI 안전 문제를 해결한다고 주장하거나, 의료 또는 임상적 응용을 논의하는 것은 아닙니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →