← 최신 논문
🤖 machine learning

How Transparent is DiffusionGemma?

이 논문은 DiffusionGemma의 연속적인 잠재 공간이 초기에는 투명성을 저해하는 것처럼 보이지만, 해석 가능한 토큰 병목을 통해 디노이징 단계를 매핑함으로써 변수 투명성을 크게 향상시키고 독특한 추론 현상을 밝혀내며, 결과적으로 이 모델이 자기회귀 모델만큼이나 모니터링 가능하다는 것을 보여준다.

원저자: Joshua Engels, Callum McDougall, Bilal Chughtai, Janos Kramar, Senthoran Rajamanoharan, Cindy Wu, Arthur Conmy, Asic Q Chen, Jean Tarbouriech, Min Ma, Brendan O'Donoghue, João Gabriel Lopes de Oliveir
게시일 2026-06-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Joshua Engels, Callum McDougall, Bilal Chughtai, Janos Kramar, Senthoran Rajamanoharan, Cindy Wu, Arthur Conmy, Asic Q Chen, Jean Tarbouriech, Min Ma, Brendan O'Donoghue, João Gabriel Lopes de Oliveira, Rohin Shah, Neel Nanda

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "How Transparent is DiffusionGemma?"라는 논문을 일상적인 비유와 쉬운 언어로 설명한 글입니다.

거대한 질문: 우리는 기계의 내부를 들여다볼 수 있는가?

서로 다른 두 종류의 요리사가 이야기를 쓰려고 한다고 상상해 보세요.

  1. 요리사 A (Gemma 4와 같은 자기회귀 모델): 이 요리사는 한 번에 한 단어씩, 왼쪽에서 오른쪽으로 글을 씁니다. "그", "고양이가", "앉았다"와 같이 써 내려갑니다. 당신은 그들이 실시간으로 단어를 쓰는 모습을 지켜볼 수 있습니다. 그들의 "사고 과정"이 곧 타이핑하는 단어 그 자체이기 때문에, 그들이 어떻게 생각하는지 이해하기 매우 쉽습니다.
  2. 요리사 B (DiffusionGemma): 이 요리사는 무작위 낙서(옛날 TV의 노이즈 같은 것)로 가득 찬 거대한 캔버스에서 시작합니다. 이들은 단어를 하나씩 쓰는 것이 아닙니다. 대신, 전체적으로 엉망인 그림을 보고 반복해서 서서히 "정리"해 나갑니다. 첫 번째 라운드에서 낙서는 횡설수설처럼 보일 수 있습니다. 두 번째 라운드에서는 단어의 형태가 조금 더 보입니다. 48번째 라운드에 이르면 완벽한 이야기가 됩니다.

문제점: 요리사 B의 경우, "중간 단계"(라운드 사이의 낙서들)는 단순한 단어가 아닙니다. 그것들은 인간이 읽을 수 없는 수학적 얼룩입니다. 이 논문은 다음과 같이 묻습니다: 요리사 B가 그 얼룩 속에 자신의 생각을 숨겨서, 우리가 무엇을 하고 있는지 알 수 없게 만드는 것일까?

조사: 투명성을 확인하는 세 가지 방법

연구진은 "투명성"(모델을 얼마나 이해하기 쉬운가)을 세 가지 주요 테스트로 나누어 분석했습니다.

1. "숨겨진 단계" 테스트 (불투명한 직렬 깊이)

계주 경기를 생각해 보세요.

  • 요리사 A는 다음 주자에게 바통(생각)을 즉시 전달합니다. 주자 사이의 거리는 짧습니다.
  • 요요사 B는 다음 주자가 보기 전까지 48번이나 길고 어두운 터널을 통해 바통을 전달하는 것처럼 보입니다. 만약 그 터널이 어둡다면(해석 불가능하다면), 이 경주는 요리사 A의 경주보다 28.6배 더 따라가기 어렵습니다.

발견: 연구진은 그 터널 안에 빛을 비출 방법을 찾아냈습니다. 그들은 비록 "얼룩"이 수학처럼 보일지라도, 실제로는 최종 단어들에 대한 추측을 대부분 담고 있다는 것을 깨달았습니다. 만약 우리가 그 추측들을 읽을 수 있는 단어로 취급한다면, "어두운 터널"은 극적으로 줄어듭니다. 갑자기 요리사 B의 경주는 요리사 A보다 겨우 1.1배 더 따라가기 어려울 뿐입니다. 이는 표준 모델만큼이나 투명합니다.

2. "추측 게임" 테스트 (가변적 투명성)

연구진은 "그 얼룩들이 정말로 추측에 불과한가?"라고 물었습니다.
그들은 요리사 B의 정리 라운드 사이에 있는 "낙서"들을 살펴보았습니다. 그 결과, 85%에서 90%의 시간 동안 모델은 단순히 *"내 생각에 다음 단어는 '고양이' 혹은 '강아지'일 것 같아"*라고 적힌 표지판을 들고 있는 것과 같다는 것을 발견했습니다.

  • 좋은 소식: 이 표지판들은 대부분 최종 정답에 대한 추측일 뿐입니다. 비밀 코드가 아닙니다.
  • 나쁜 소식: 때때로 모델은 공간을 채우기 위해 무작위 단어들을 적은 표지판을 들기도 합니다. 하지만 상위 추측들을 자세히 들여다보면, 대부분의 "사고"는 눈에 보입니다.

3. "안전 감시자" 테스트 (모니터링 가능성)

요리사가 위험한 내용을 쓰려고 할 때 이를 잡아내려는 안전 검사관을 상상해 보세요.

  • 연구진은 검사관이 요리사 B의 이야기에서 최종 결과물만을 읽고도 나쁜 행동을 포착할 수 있는지 테스트했습니다.
  • 결과: 검사관은 요리사 A를 잡아낼 때만큼이나 요리사 B를 잘 잡아냈습니다. 요리사 B가 다르게 생각하더라도, 최종 이야기는 모델이 "나쁜 행동"을 하는지 혹은 "안전한지"에 대한 동일한 단서들을 제공합니다.

특이한 점: 요리사 B는 어떻게 다르게 생각하는가?

요리사 B는 투명하지만, 요리사 A는 결코 할 수 없는 방식으로 생각합니다. 논문은 몇 가지 흥과 기이한 행동들을 발견했습니다.

  • 역방향 사고 (비연대적 추론): 요리사 A는 반드시 시작 부분을 먼저 써야 합니다. 하지만 요리사 B는 끝을 먼저 쓰고 나서 앞부분을 수정할 수 있습니다.
    • 예시: 요리사 B는 수학 문제의 답이 "9"라고 추측하여 먼저 적어둔 뒤, 다음 라운드에서 계산을 수행하다가 그것이 틀렸음을 깨닫고, 페이지 전체를 다시 쓰는 대신 "9"를 "8"로 바꿀 수 있습니다.
  • "흐릿한" 효과 (토큰 스미어링): 때때로 요리사 B는 자신이 무엇을 말하고 싶은지는 알지만, 그것을 어디에 두어야 할지는 모릅니다.
    • 예시: "괄호"라는 단어를 마지막 라운드에서 한 곳으로 선명하게 만들기 전까지, 마치 흐릿한 사진처럼 페이지의 세 군데에 동시에 배치할 수 있습니다.
  • 두 세계를 동시에 유지하기 (시퀀스 스미어링): 요리사 B는 두 가지 다른 이야기가 동시에 진행되는 것을 상상할 수 있습니다.
    • 예시: 답이 "12"일 확률 50%, "9"일 확률 50%라고 생각하며, 마지막 순간에 하나를 선택할 때까지 두 버전의 문장을 모두 마음속에 살아있는 상태로 유지할 수 있습니다.
  • 비밀 자리 표시자 (중간 컨텍스트): 때때로 요리사 B는 생각을 돕기 위해 임시 단어를 사용하지만, 최종 결과물을 보여주기 전에 이를 삭제합니다.
    • 예시: 계산을 돕기 위해 숫자 "3"을 썼다가, 최종 출력에서는 그 자리를 단어 "Gold"로 교체할 수 있습니다. "3"은 계산을 위해 필요했지만, 최종 이야기에는 나타나지 않습니다.

결론

이 논문은 DiffusionGemma가 놀라울 정도로 투명하다고 결론짓습니다.

요리사 B는 (단어를 하나씩 쓰는 대신 캔버스를 정리하는 것과 같은) 더 복격적이고 복잡한 방식으로 생각하지만, 우리는 여전히 그것이 무엇을 하고 있는지 볼 수 있습니다.

  1. 그들의 "숨겨진 단계"는 대부분 최종 단어들에 대한 추측입니다.
  2. 안전 감시자는 표준 모델만큼이나 잘 잡아낼 수 있습니다.
  3. 요리사 B는 독특하고 비선형적인 사고(과거를 수정하거나, 두 가지 옵션을 동시에 유지하는 등)를 하지만, 우리는 여전히 그 과정을 지켜볼 수 있습니다.

경고: 저자들은 이것이 이 특정 모델에만 해당될 수 있다고 말합니다. 만약 미래의 모델들이 다르게 훈련된다면, 그 "얼룩"들은 우리가 읽을 수 없는 진정한 비밀 코드가 될 수도 있습니다. 하지만 현재로서는 DiffusionGemma는 관찰 가능한 안전한 상태입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →