← 최신 논문
💻 computer science

Omission Constraints Decay While Commission Constraints Persist in Long-Context LLM Agents

이 논문은 장문맥 LLM 에이전트에서 금지 명령 (생략) 은 문맥이 길어질수록 준수율이 급격히 떨어지는 반면 요구 사항 명령 (실행) 은 유지되는 '보안-회상 발산' 현상을 발견하고, 이를 모델별 안전 턴 깊이 이전에 제약을 재주입함으로써 재학습 없이 해결할 수 있음을 보여줍니다.

원저자: Yeran Gamage

게시일 2026-04-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yeran Gamage

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🕵️‍♂️ 핵심 발견: "할 일은 기억하는데, 하지 말라는 건 잊어버려요"

상상해 보세요. AI 비서가 당신과 1 시간, 2 시간, 혹은 그 이상 대화를 나누고 있다고 가정해 봅시다.

  • 할 일 (Commission): "대화를 시작할 때마다 'STATUS:'라고 적어줘."
  • 하지 말 일 (Omission): "절대 불릿 포인트 (-) 를 사용하지 마."

연구 결과, AI 는 오랜 시간이 지나도 '할 일'은 100% 정확히 기억해 냅니다. 하지만 '하지 말 일'은 시간이 지날수록 점점 잊어버립니다.

마치 장시간 운전하는 택시 기사를 생각해 보세요.

  • "손님에게 인사하세요" (할 일) → 10 시간 운전해도 잊지 않아요.
  • "빨간불에 절대 멈추지 마세요" (하지 말 일) → 10 시간 운전하고 피곤해지면, 신호를 보지 않고 그냥 지나갈 수도 있어요.

이 현상을 연구자들은 **'보안 - 기억 분리 (Security-Recall Divergence)'**라고 이름 지었습니다.

📉 왜 이런 일이 일어날까요? (비유: 기억력 과부하)

AI 는 대화할 때마다 새로운 정보를 '기억 창 (Context Window)'에 쌓아둡니다.

  1. 초반 (Turn 5): AI 의 기억 창은 비어 있습니다. "불릿 포인트 금지"라는 규칙이 가장 앞에 있으니, AI 는 규칙을 잘 따릅니다.
  2. 중반 (Turn 16): 대화 내용이 길어지고, 클라우드 설정 같은 복잡한 데이터가 많이 쌓입니다.
  3. 후반 (Turn 25): 규칙이 적힌 메모지가 기억 창 가장 구석으로 밀려납니다. AI 는 지금 당장 대화 중인 내용 (가장 최근 정보) 에 집중하느라, 구석에 있는 "금지 규칙"을 보지 못하게 됩니다.

이를 **'주의력 희석 (Attention Dilution)'**이라고 합니다. 규칙이 사라진 게 아니라, AI 의 시야에서 멀어져서 잊혀진 것입니다.

🎭 가장 무서운 점: "모두가 안전해 보이는 착시"

이 연구의 가장 큰 충격은 감시 시스템이 이를 알아채지 못한다는 점입니다.

  • 감시 시스템 (Audit): "AI 가 'STATUS:'를 잘 적었나? (할 일)" → O (안전함)
  • 실제 위험: "AI 가 금지된 비밀번호를 흘렸나? (하지 말 일)" → X (위험함)

감시 시스템은 "할 일"을 잘 수행했으니 "AI 는 안전하다"고 보고합니다. 하지만 실제로는 "하지 말 일"을 위반하고 있을 수 있습니다. 마치 불이 난 건방진 소방관이 "소방복은 잘 입었으니 (할 일), 불은 안 났다"고 말하는 것과 같습니다.

🛡️ 어떻게 해결할까요? (실천 가능한 해결책)

이 연구는 AI 를 다시 훈련시킬 필요 없이, 운영자가 즉시 적용할 수 있는 두 가지 간단한 해결책을 제시합니다.

  1. 규칙을 다시 읽어주기 (Periodic Re-injection):

    • AI 가 10~15 회 대화를 나누면, "아직도 불릿 포인트 금지 규칙 기억해?"라고 다시 물어보거나 시스템 메시지에 규칙을 다시 넣어주세요.
    • 비유: 장시간 운전할 때, "속도 제한 지키세요"라는 표지판을 중간중간 다시 세워주는 것과 같습니다.
  2. 대화 시간 제한 (Safe Turn Depth):

    • 각 AI 모델마다 "이 정도 대화까지 하면 규칙을 잊기 시작한다"는 한계점 (STD) 이 있습니다. 예를 들어 어떤 모델은 10 회 대화면 위험해집니다.
    • 비유: 운전 시간이 10 시간이면 휴식하고 새 기사가 운전대를 잡는 것처럼, 대화 횟수가 한계에 다다르면 세션을 끊고 새로 시작하세요.

💡 결론

이 논문은 **"AI 가 안전하다고 해서 진짜 안전한 건 아니다"**라고 경고합니다.

우리는 AI 가 "하지 말아야 할 것"을 잊어버릴 수 있다는 사실을 몰랐습니다. 하지만 이제 우리는 그 한계를 알고, 규칙을 다시 상기시키거나 대화를 적절히 끊음으로써 AI 를 안전하게 만들 수 있습니다.

한 줄 요약:

"AI 는 장시간 대화하면 '하지 말라'는 규칙을 잊어버리지만, '하라'는 규칙은 기억합니다. 그래서 겉보기엔 안전해 보이지만, 실제로는 위험할 수 있으니 규칙을 자주 상기시켜 주세요."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →