← 최신 논문
🤖 machine learning

Barriers to Counterfactual Credit Attribution for Autoregressive Models

본 논문은 자기회귀 생성 모델에서 반사실적 신용 귀속 (CCA) 을 구현하는 데 따른 과제를 조사하여, CCA 가 자기회귀적으로 구성되지 않으며 기존 모델을 CCA 를 만족하도록 재구성하는 데는 출력 길이에 대해 지수적으로 증가하는 쿼리 복잡도가 필요함을 보여준다.

원저자: Aloni Cohen, Chenhao Zhang

게시일 2026-05-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Aloni Cohen, Chenhao Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 방금 맛있는 새로운 수프를 발명한 요리사라고 상상해 보세요. 옛날에는 특정 농부로부터 비밀 향료를 사용했다면 자연스럽게 "이 수프는 존 농부의 향료 덕분에 맛이 훌륭합니다"라고 말했을 것입니다. 공은 그에게 돌려져야 합니다.

하지만 이제 마법 같은 '수프 봇'을 가지고 있다고 상상해 보세요. 당신은 재료 목록(데이터베이스)을 봇에 입력하고, 봇은 수프를 빠르게 만들어냅니다. 문제는 이 봇이 블랙박스라는 점입니다. 봇은 모든 것을 너무 완벽하게 섞어서 어떤 특정 재료가 수프의 맛을 그렇게 만들었는지 알 수 없습니다. 수프에 어떤 요소가 영향을 미쳤는지 알 수 없다면 농부들에게 공을 돌릴 수도 없습니다. 이 논문은 그 향료가 실제로 레시피에 필수적이었을 때마다 봇이 "나는 존 농부의 향료를 사용했습니다"라고 말하도록 강제할 수 있는 방법이 필요하다고 주장합니다.

저자들은 이를 **반사실적 공로 귀속 (Counterfactual Credit Attribution, CCA)**이라고 부릅니다. 이는 다음과 같은 fancy 한 표현입니다: "존 농부의 향료를 목록에서 제거했다면 수프의 맛이 여전히 같았을까요?" 만약 답이 "아니요, 맛이 달라졌을 것입니다"라면, 봇은 존 농부에게 반드시 공을 돌려야 합니다.

이 논문은 이 '공로 돌리기 봇'을 구축하는 두 가지 자연스러운 방법을 탐구하며, 둘 다 거대한 벽에 부딪혔음을 발견합니다.

1. '단계별' 접근법 (자기회귀 모델)

이 요약을 작성하는 AI 와 같은 대부분의 현대 AI 는 한 단어씩 이야기를 쓰는 사람처럼 작동합니다. 한 단어를 선택하고, 다음 단어를 선택하고, 그 다음 단어를 선택합니다.

아이디어: 아마도 봇이 선택하는 각각의 개별 단어에 대해 공로를 돌리도록 가르칠 수 있을까요? 봇이 존 농부의 향료에 의존하는 단어를 선택하면 그에게 공로를 돌리는 것입니다. 그런 다음 모든 단어를 연결하여 완전한 수프를 만들면 됩니다.

문제점: 이 논문은 이것이 작동하지 않는다고 증명합니다.

  • 비유: 블록으로 탑을 쌓는다고 상상해 보세요. 규칙이 하나 있습니다: "매번 블록을 놓을 때마다 그 블록이 안정적인지 확인해야 합니다." 당신은 이 규칙을 모든 블록에 대해 완벽하게 따릅니다. 하지만 물러서서 바라보면 탑 전체가 무너집니다.
  • 현실: 저자들은 봇이 생성하는 모든 개별 단어에 대해 공로를 돌리는 데 완벽하다 하더라도, 최종 이야기 (전체 시퀀스) 가 여전히 공로를 제대로 돌리지 못할 수 있음을 보여줍니다. '공로'는 단어들이 쌓여감에 따라 손실되거나 왜곡됩니다. 개별 벽돌의 안정성만 확인하여 안정적인 집을 짓는 것과 같습니다. 구조 전체는 여전히 무너질 수 있습니다.

2. '리트로핏' 접근법 (나중에 공로 추가)

아이디어: 이미 수프는 잘 만들지만 공로를 돌리는 데는 서툰 봇이 있다고 가정해 보세요. 그 봇 주위에 '래퍼 (wrapper)'를 씌울 수 있을까요? 이 래퍼는 봇이 수프를 만드는 것을 지켜본 후, "좋아, 이제 '공로: 존 농부'라는 메모를 추가하겠습니다"라고 결정할 것입니다.

문제점: 이 논문은 이것이 계산적으로 불가능하다고 증명합니다 (또는 적어도 불가능에 가까울 정도로 어렵습니다).

  • 비유: 100 자리 숫자 코드를 생성하는 잠긴 금고가 있다고 상상해 보세요. 당신은 금고에 "이 코드는 숫자 7 의 영향을 받았습니다"라는 라벨을 붙이고 싶습니다. 이를 위해 금고 안을 엿보아 숫자 7 이 실제로 사용되었는지 확인해야 합니다.
  • 현실: 저자들은 봇이 출력을 생성하는 데 특정 데이터 (예: 존 농부의 향료) 를 정말로 필요로 했는지 파악하려면, 봇에게 수프를 수조 번, 그 이상으로 (지수적으로 많은 횟수) 생성하도록 요청해야만 확신할 수 있음을 보여줍니다. 해변의 모래알 하나를 찾아내기 위해 모든 모래알을 하나씩 파헤치는 것과 같습니다. 단순히 '충분히 좋은' 추측을 원하더라도 수학은 여전히 거의 해변 전체를 파헤쳐야 한다고 말합니다.

핵심 결론

이 논문은 현재 우리가 큰 장애물에 직면해 있다고 결론 내립니다.

  1. 우리는 단계별 (단어별) 로 공로를 돌리도록 AI 를 구축함으로써 공로를 돌리는 AI 를 단순히 만들 수 없습니다.
  2. 기존 AI 에 공로 돌리기 계층을 나중에 덧붙이는 방식으로 쉽게 고칠 수 없으며, 이는 불가능한 양의 작업을 요구합니다.

저자들은 또한 기이한 부작용을 지적합니다: 이 '공로 시스템'의 엄격한 규칙을 충족시키기 위해 봇은 수프의 맛을 거의 바꾸지 않은 재료들에게도 공로를 돌려야 할지도 모릅니다. 마치 수학적으로 '필요했을지도 모른다'는 이유만으로 실제로 맛을 바꾸지 않은 소금 한 알에 대해 농부에게 감사해야 하는 것처럼 말입니다.

간단히 말해: 출처에 대해 신뢰할 수 있고 효율적으로 공로를 돌리는 AI 를 만드는 것은 우리가 생각했던 것보다 훨씬 어렵습니다. 그리고 두 가지 가장 명백한 해결책은 작동하지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →