← 최신 논문
🤖 AI

Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems

본 논문은 프롬프트로 구성된 에이전트 시스템에서 발생하는 미묘한 실패 모드인 '조합적 행동 누출(compositional behavioral leakage, CBL)'을 식별하고 정형화하며, 이는 트랜스포머 셀프 어텐션의 구조적 비격리성으로 인해 하나의 프롬프트 모듈을 편집하는 것이 다른 모듈의 행동을 암묵적으로 변화시키는 현상으로, 이러한 간섭이 개별 결정 단계에서는 흔히 임계값 미만일지라도 대규모 배포 시에는 상당한 복합적 위험을 초래한다는 것을 실증적 실험을 통해 입증한다.

원저자: Ching-Yu Lin, Yifan Liu

게시일 2026-06-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ching-Yu Lin, Yifan Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 서로 다른 지침서들을 이어 붙여 로봇 비서를 만들고 있다고 상상해 보세요. 당신에게는 "예의 바르게 행동하는 법"에 대한 페이지 한 장, "직원을 채용하는 법"에 대한 또 다른 페이지 한 장, 그리고 "코드를 작성하는 법"에 대한 세 번째 페이지가 있습니다. 당신은 이 모든 것을 하나의 거대한 문서로 풀로 붙인 뒤, 로봇(AI)에게 건네주며 읽으라고 합니다.

모든 사람이 하는 커다란 가정은 이것입니다: "내가 '예의 바르게 행동하는 법' 페이지를 수정하더라도, 로봇이 '채용' 업무를 수행하는 방식에는 실수로 영향을 미치지 않을 것이다."

이 논문은 말합니다: 그 가정은 틀렸습니다.

다음은 연구진이 발견한 내용을 쉬운 비유를 들어 설명한 것입니다.

1. 문제점: "지침 침범 (Instruction Bleed)"

연구진은 이 현상을 "지침 침범"(또는 구성적 행동 누출, Compositional Behavioral Leakage)이라고 부릅니다.

AI의 뇌를 모든 지침 페이지가 바닥에 펼쳐져 있는 거대하고 탁 트인 방이라고 생각해 보세요. 일반적인 컴퓨터 프로그램에서는 "주방" 섹션의 규칙을 변경해도 "차고" 섹션은 정확히 그대로 유지됩니다. 왜냐하면 두 섹션이 서로 다른 방에 있기 때문입니다.

하지만 AI의 경우, 그 "방"은 하나의 커다란 개방된 공간입니다. AI는 모든 것을 한꺼번에 읽으며, 모든 단어를 다른 모든 단어와 연결합니다. 연구진은 만약 당신이 (채용 매뉴얼에 상관없는 무작위 레시피를 추가하는 것처럼) 전혀 상관없는 페이지를 몰래 수정한다면, 그것이 AI가 구직자를 평가하는 점수를 조용히 변화시킬 수 있다는 것을 발견했습니다.

비유: 당신이 이야기를 쓰고 있다고 상상해 보세요. 만약 "자동차 수리"에 관한 장의 중간에 갑자기 "매운 고추"에 관한 단락을 추가한다면, AI는 당신이 직접 말하지 않았음에도 불구하고 자동차 수리가 "매콤하거나" "뜨거워야" 한다고 무의식적으로 생각하기 시작할 수 있습니다. 의미가 한 섹션에서 다른 섹션으로 "침범"하는 것입니다.

2. 실험: 직업 면접 봇

이를 증명하기 위해 연구진은 실제 직업 지원서를 평가하도록 설계된 실제 AI 에이전트를 사용하여 특정 테스트를 구축했습니다.

  • 설정: 그들은 "중점" 모듈(이력서가 직무와 얼마나 잘 맞는지 점수를 매기는 부분)을 만들었습니다.
  • 속임수: 그들은 완전히 무관한 모듈(레시피를 평가하는 규칙 세트)을 가져와 세 가지 유형의 변화를 주었습니다:
    1. 분량: 단순히 레시피 섹션을 더 길게 만드는 것.
    2. 내용: 레시피 규칙에 이상하고 관련 없는 캐릭터 설명을 추가하는 것.
    3. 형태: 단어를 바꾸지 않고 레시피 섹션의 폰트, 이모지, 또는 헤딩(제목)을 변경하는 것.

결과:

  • 분량이나 형태(이모지/헤딩)를 바꾸는 것은 채용 점수에 큰 영향을 미치지 않았습니다.
  • 하지만, 내용(그 이상한 캐릭터 설명을 추가하는 것)을 바꾸자, AI가 구직자를 평가하는 방식이 체계적으로 변했습니다.
  • 점수는 약간씩 이동했지만, 일관되게 변했습니다. AI가 모든 사람을 거부하거나 모두를 채용하기 시작한 것이 아니라, 단지 점수를 약간 다르게 부여했을 뿐입니다.

3. 이것이 중요한 이유: "조용한 표류 (Silent Drift)"

이 발견에서 가장 무서운 부분은 아무도 이것이 일어나고 있다는 사실을 알아차리지 못했다는 점입니다.

  • "임계값 미만" 효과: AI는 큰 실수(예: 외과의사 직무에 광대를 채용하는 것)를 저지르지 않았습니다. 대신, 점수를 아주 미세하게 이동시켰을 뿐입니다.
  • 비유: 사과 무게를 재기로 되어 있는 저울이 있다고 상상해 보세요. 만약 당신이 방 반대편에 무거운 책을 놓는다면(관련 없는 지침), 저울이 고장 나지는 않지만, 모든 사과의 무게를 0.5파운드씩 더 무겁게 측정하기 시작할 것입니다. 단 하나의 사과가 "폭발"하거나 사라지는 것을 보지는 못하겠지만, 1,000개의 사과를 무게를 잰다면 당신의 전체 재고 수량은 틀리게 될 것입니다.
  • 위험성: 현실 세계에서 AI가 수천 명의 구직자를 순위 매기는 데 사용된다면, 이러한 미세하고 조용한 변화는 AI가 완벽하게 작동하는 것처럼 보이더라도 누가 면접을 보고 누가 탈락할지를 결정짓는 데 영향을 줄 수 있습니다.

4. 왜 이런 일이 발생하는가?

논문은 AI의 아키텍처(트랜스포머라고 불리는)가 문서 전체를 한꺼번에 보도록 설계되어 있다고 설명합니다. AI에게는 서로 다른 지침 모듈 사이의 "벽"이 없습니다.

  • "벽이 없는" 현실: 당신이 텍스트에 별표 줄(***)을 넣거나 ### 채용 규칙과 같은 헤딩을 넣더라도, AI는 이를 엄격한 경계로 취급하지 않습니다. AI에게 그것은 그저 하나의 거대한 단어 흐름일 뿐입니다.
  • "메모리" 문제: AI는 제한된 "작업 기억(working memory)"을 가지고 있습니다. 텍스트를 추가하면(심지어 관련 없는 텍스트라도), 그것이 원래의 작업에 완벽하게 집중하는 데 필요한 공간을 밀어내어 압박하게 됩니다.

5. 연구진이 제안하는 해결책

이 논문은 문제점만을 지적하는 데 그치지 않고, 이를 테스트하는 새로운 방법을 제시합니다.

  • 새로운 테스트: AI 시스템을 출시하기 전에, 단순히 제대로 작동하는지 확인하는 것만으로는 부족합니다. 한 부분의 지침을 바꾸는 것이 다른 부분의 작동을 망가뜨리는지 확인해야 합니다.
  • "회귀(Regression)" 테스트: 개발자가 새로운 지침 모듈을 추가할 때마다, 새로운 추가 사항이 기존 모듈에 "침범"을 일으키지 않았는지 확인하기 위해 기존 모듈을 반드시 다시 테스트해야 한다고 제안합니다.

요약

이 논문은 우리가 다양한 텍스트 지침을 이어 붙여 AI 에이전트를 만들 때, 흔들리는 지반 위에 집을 짓고 있다는 사실을 밝혀냅니다. 지침의 한 부분을 바꾸는 것은, 그 변화가 무관해 보이더라도 AI가 다른 부분에서 행동하는 방식을 미세하고 은밀하게 바꿀 수 있습니다. 이는 현재의 테스트 방법들이 놓치고 있는 "조용한 표류"이며, 채용이나 대출과 같은 의사결정에 실질적인 결과를 초래할 수 있습니다. 저자들은 이러한 보이지 않는 누출을 잡아내기 위한 새로운 체크리스트를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →