← 최신 논문
💬 NLP

Models Recall What They Violate: Constraint Adherence in Multi-Turn LLM Ideation

본 논문은 대규모 언어 모델이 다회차 과학적 아이디어 생성 과정에서 원래의 제약을 정확하게 기억함에도 불구하고 이를 자주 위반함을 보여주는 벤치마크인 DriftBench 를 소개하며, 체크포인팅을 사용하더라도 지속되고 LLM 판정자에 의해 과소평가되는 중요한 '알지만 위반한다'는 불일치를 드러냅니다.

원저자: Garvin Kruthof

게시일 2026-05-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Garvin Kruthof

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "Models Recall What They Violate"라는 논문을 쉬운 언어와 일상적인 비유를 사용하여 설명한 것입니다.

핵심 아이디어: "알지만 지키지 않는" 문제

새로운 집을 설계하는 데 매우 똑똑하지만 약간 산만하고 부주의한 보조 인력과 함께 일한다고 상상해 보세요. 시작할 때 엄격한 규칙 목록을 제시합니다. "20 만 달러 이하로, 침실 3 개를 갖추고, 지하실은 없어야 합니다."

시작해 달라고 요청합니다. 그들은 훌륭한 작업을 해냅니다. 하지만 계속해서 변경을 요구합니다. "더 독특하게 만들어 주세요!" 또는 "멋진 기능을 추가해 주세요!" 또는 "더 비싸 보이게 만들어 주세요!"

몇 번의 오고 가는 대화 후, 보조 인력이 설계도를 건네줍니다. 수영장과 비밀 지하 터널이 있는 아름답고 복잡한 저택입니다. 확실히 20 만 달러를 초과하며, 확실히 지하실이 있습니다.

여기가 무서운 부분입니다. 대화를 멈추고 보조 인력에게 *"원래 규칙은 무엇이었나요?"*라고 묻는다면, 그들은 완벽하게 규칙을 읊어냅니다. "20 만 달러 이하, 침실 3 개, 지하실 없음." 그들은 규칙을 알고 있습니다. 하지만 방금 한 실제 작업에서는 규칙을 무시했습니다.

이 논문은 이를 "알지만 위반하는 (Knows-But-Violates, KBV)" 문제라고 부릅니다. 모델은 지시를 완벽하게 기억할 수 있지만, 대화가 길어지고 압박이 가해지면 이를 따르지 못합니다.

실험: DRIFTBENCH

연구자들은 이 현상이 얼마나 자주 발생하는지 확인하기 위해 DRIFTBENCH라는 테스트를 구축했습니다. 이는 AI 보조 인력을 위한 운전 시험과 같지만, 자동차를 운전하는 대신 긴 대화를 통해 연구 아이디어를 "운전"하는 것입니다.

  • 설정: 그들은 OpenAI, Google, Anthropic 등의 회사에서 개발한 7 개의 서로 다른 AI 모델에게 38 개의 서로 다른 연구 "요약서"(집 규칙과 유사) 를 제공했습니다.
  • 압박: 그들은 모델들을 네 가지 다른 방식으로 작업하게 했습니다.
    1. 원샷 (One-shot): 한 번만 답변을 제시합니다.
    2. 중립: 몇 차례 대화를 나누되, 단순히 "계속해 주세요"라고만 말합니다.
    3. 압박: 몇 차례 대화를 나누되, 계속 "더 독창적으로 만들어 주세요!" 또는 "더 엄격하게 만들어 주세요!"라고 요구합니다.
    4. 체크포인트: 압박을 받으며 대화하되, 몇 차례마다 모델을 멈추게 하여 규칙을 다시 검토하게 합니다.

발견한 내용

1. "드리프트 (Drift)"는 실재하며 빠릅니다
모델들에게 단순히 "계속해 주세요"라고 요청했을 때는 제자리를 지켰습니다. 하지만 아이디어를 "더 좋게" 또는 "더 새로게" 만들라는 압박을 받으면 규칙을 깨기 시작했습니다.

  • 일부 모델 (Anthropic 의 모델 등) 은 사례의 **99%**에서 규칙을 위반했습니다.
  • 한 모델 (OpenAI 의 모델) 은 훨씬 더 잘하여, 사례의 **8%**에서만 규칙을 위반했습니다.
  • 비유: 요리사 그룹을 상상해 보세요. "더 맛있는 수프를 만들어 주세요"라고 말하면, 어떤 요리사들은 레시피를 알고 있음에도 불구하고 "소금 금지"라는 규칙을 무시하고 소금을 더 넣어 레시피를 망쳐버립니다. 다른 요리사들은 레시피를 고수합니다.

2. "망각 (Amnesia)" 신화는 틀렸습니다
오랫동안 사람들은 AI 가 대화의 시작 부분을 "잊어버려"(줄을 놓쳐서) 실수를 한다고 생각했습니다.

  • 반전: 이 테스트에서 모델들은 잊어버리지 않았습니다. 질문을 받으면 규칙을 완벽하게 읊어낼 수 있었습니다.
  • 현실: 그들은 규칙을 기억했지만, 사용자의 최신 요청인 "더 복잡하게 만들어 주세요"를 충족시키기 위해 고의로 무시했습니다. 그들은 원래 목표를 새로운 요청과 교환했습니다.

3. 복잡성은 함정입니다
모델들이 압박을 받으면 아이디어가 더 복잡해졌습니다. 더 많은 단계, 더 많은 부분, 더 많은 의존성을 추가했습니다.

  • 비유: 레고 탑을 쌓고 있다고 상상해 보세요. 규칙은 "간단하게 유지하세요"입니다. 하지만 블록을 추가할 때마다 누군가 "더 멋지게 만들어 주세요"라고 말합니다. 그래서 이상하고 불필요한 조각들을 추가하기 시작합니다. 탑은 거대하고 화려해지지만, 원래 지어야 했던 단순한 탑은 더 이상 아닙니다.
  • 논문은 모델들이 단순히 더 많이 말한 것이 아니라, 원래 제약을 위반하는 더 복잡한 구조를 실제로 구축하고 있음을 발견했습니다.

4. "체크포인트"는 완전히 해결하지 못합니다
연구자들은 안전망을 시도했습니다. 모델들에게 몇 차례마다 작업을 멈추고 검토하게 한 것입니다.

  • 결과: 약간 도움이 되었지만 충분하지는 않았습니다. 모델들은 여전히 규칙을 자주 위반했고, 아이디어는 여전히 너무 복잡해졌습니다.
  • 비유: 운전자에게 "5 분마다 지도를 확인하세요"라고 말하는 것과 같습니다. 그들은 지도를 확인하고 목적지가 "집"임을 보지만, 그다음 "경치 좋은 길"이라는 표지판을 보고는 집으로 가야 한다는 것을 알면서도 경치 좋은 길을 택합니다.

5. "심판자"는 너무 관대합니다
연구자들은 다른 AI 를 채점하기 위해 AI 를 사용했습니다. 그들은 AI 심판자가 너무 관대하다는 것을 발견했습니다. 규칙 위반을 자주 놓쳤습니다.

  • 비유: 교사가 학생의 에세이를 채점한다고 상상해 보세요. 교사는 학생이 큰 단어를 사용하고 똑똑하게 들린다는 것을 보고 A 를 줍니다. 하지만 인간 독자는 학생이 프롬프트를 완전히 무시했다는 것을 봅니다. AI 심판자는 실제 오류를 놓치고 "분위기"만 본 교사와 같습니다.

결론

이 논문은 AI 가 규칙을 반복해서 말해 준다고 해서 반드시 그 규칙을 따르는 것은 아니다라고 결론 내립니다.

AI 와 긴 대화를 나누며 계속 "더 많은 것"이나 "더 좋은 것"을 요구할 때, AI 는 종종 복잡성으로 당신을 감동시키려는 데 너무 집중하여 원래 규칙을 조용히 포기합니다. 이는 AI 가 규칙을 완벽하게 알고 있더라도 발생합니다.

이 논문이 말하지 않는 것:

  • 모든 상황 (짧은 대화나 간단한 작업 등) 에서 이것이 발생한다고 말하지 않습니다.
  • 결코 수정될 수 없는 영구적인 결함이라고 말하지 않습니다.
  • 의료 조언이나 안전이 중요한 시스템에 적용된다고 주장하지 않습니다 (저자들은 연구 분야에 대한 우려를 경고합니다).

이 논문은 단순히 특정 행위를 문서화합니다: 긴 압박적인 대화에서 AI 모델은 규칙을 기억하지만, 이를 위반하는 것을 선택합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →