Denoising Models Develop Human-Like Perceptual Illusion Representations Across Architectures
이 논문은 다양한 아키텍처를 가진 디노이징 모델들이 인간의 밝기 착시와 상관관계가 있는 내부적 "지각적 환영(perceptual phantom)" 표현을 발달시키며, 이것이 심리물리학적 모델과 연관되고 내부 처리에 인과적인 영향을 미치지만 최종 출력물에서는 감지되지 않는다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 한 폭의 그림을 보고 있다고 상상해 보세요. 흰색 배경 위에 회색 정사각형 하나가 놓여 있고, 검은색 배경 위에도 똑같이 생긴 회색 정사각형 하나가 놓여 있습니다. 두 정사각형은 색상이 완전히 동일함에도 불구하고, 당신의 뇌는 검은색 배경 위의 정사각형을 훨씬 더 밝게 보이도록 속입니다. 이것은 시각적 착각이며, 우리의 뇌가 세상을 이해하기 위해 어떻게 설계되었는지를 보여주는 인지적 오류입니다. 오랫동안 과학자들은 우리가 만드는 인공 지능(딥 뉴럴 네트워크라고 불리는)도 이와 같은 방식으로 속을 수 있는지 궁금해했습니다. 그들은 AI 모델이 노이즈가 섞인 사진을 깨끗하게 만들거나 새로운 이미지를 생성하려고 할 때, 인간과 똑같은 "실수"를 저지르며 존재하지 않는 밝기를 본다는 사실을 발견했습니다. 하지만 여기에 거대한 미스터리가 있습니다. AI가 자신의 마음속에서 실제로 그 착각을 '보고' 있는 것일까요, 아니면 단지 마지막 단계에서 올바른 이미지를 만들어냄으로써 흉내를 내고 있는 것일까요? 이것은 마치 마술사가 주머니 속에 실제로 토끼를 넣고 있는 것인지, 아니면 그저 토끼가 들어 있는 것처럼 보이는 모자에서 토끼를 꺼내는 것인지 묻는 것과 같습니다.
이 논문은 이 질문에 답하기 위해 이 AI 모델들의 "마음" 내부를 깊숙이 파고듭니다. 연구진은 이미지를 깨끗하게 만드는 데 설계된 다양한 AI 모델(디노이징 모델이라고 불림)들을 테스트했으며, 이 모델들이 까다로운 광학적 착각을 처리할 때 내부 레이어에서 어떤 일이 일어나는지 관찰했습니다. 그들은 흥미롭고도 약간은 기묘한 사실을 발견했습니다. AI 모델들이 착각에 대한 내부적인 표현을 실제로 발달시키지만, 그것은 '유령'과 같다는 것입니다. "이것이 밝아 보인다"라고 알려주는 신호가 생성되어 네트워크를 타고 흐르며, 심지어 AI가 이미지를 어떻게 생각하는지에도 영향을 미칩니다. 하지만 AI가 작업을 마치고 최종 결과물을 내놓을 때쯤이면, 그 유령 신호는 완전히 사라져 버립니다. AI는 내부적으로 착각에 홀려 있지만, 최종 결과물에는 결코 그것을 드러내지 않습니다. 연구진은 이 보이지 않는 내부 신호를 "지각적 환영(perceptual phantoms)"이라고 부릅니다.
기계 속의 유령
연구진이 이 유령들을 어떻게 찾아냈는지 이해하기 위해, AI 모델을 거대한 다층 공장이라고 상상해 보세요. 노이즈가 섞인 가공되지 않은 이미지가 바닥으로 들어오면, 깨끗하고 완벽한 이미지가 꼭대기에서 나옵니다. 그 사이에는 이미지가 처리되고 변형되며 정제되는 수십 개의 층(레이어)이 있습니다. 연구진은 단순히 최종 결과물만 본 것이 아니라, 모든 층에 카메라를 설치하여 일꾼들(AI의 뉴런)이 무엇을 하고 있는지 관찰했습니다.
그들은 두 개의 동일한 색상 패치가 주변 환경 때문에 다르게 보이는 "GVL" 데이터셋과 같이 시각적 트릭을 일으키기로 유명한 특수 이미지 세트를 사용했습니다. 이 이미지들을 AI에 입력하고 공장의 각 부분에서 발생하는 활동 수준을 관찰했습니다. 그들이 발견한 것은 착각이 모든 곳에서 나타나는 것이 아니라는 점이었습니다. 대신, "유령" 신호는 AI가 수집한 모든 정보를 압축하는 지점인 "병목(bottleneck)"이라 불리는 공장 중간의 아주 좁은 복도에서 가장 강력하게 나타났습니다.
여기 반전이 있습니다. 연구진은 이 내부 신호가 매우 실재한다는 것을 발견했습니다. 두 착각 패치 사이의 AI 활동 변화를 측정했을 때, 그 차이는 매우 컸습니다. (0.5를 '중간' 효과로 볼 때 약 0.66이었습니다.) 이는 AI가 일반적인 이미지를 처리할 때와는 확실히 다르게 착각을 처리하고 있었음을 의미합니다. 실제로 이 내부 신호의 강도는 인간의 지각과 매우 잘 일치했는데, AI의 활동을 인간 시각의 수학적 모델(FLODOG)과 비교했을 때 0.78이라는 상관관계를 보였습니다. 이는 AI가 놀라울 정도로 인간의 뇌와 유사한 방식으로 밝기에 대해 생각하고 있음을 시사하는 매우 강력한 일치입니다.
환영의 속성
하지만 연구진은 백만 달러짜리 질문을 던졌습니다. 만약 AI가 이토록 강하게 착각을 생각하고 있다면, 왜 최종 사진은 달라 보이지 않는 걸까요? 이에 답하기 위해 그들은 공장을 대상으로 "차이점 찾기" 게임을 했습니다. 그들은 착각 이미지로부터 얻은 내부 "유령" 신호를 가져와서 일반적인 이미지의 처리 과정에 주입해 보았습니다. 그들은 주입된 신호로 인해 최종 사진이 변하며 착각을 보여주기를 기대했습니다.
하지만 그렇지 않았습니다.
표준 "U-Net" 공장이든 최신 "트랜스포머(Transformer)" 스타일의 공장이든, 어떤 유형의 AI 모델을 사용하더라도 주입된 유령 신호는 출구에 도달하기 전에 사라졌습니다. 최종 이미지는 유령이 전혀 없었던 것처럼 정확히 똑같았습니다. 연구진은 이를 "지각적 환영"이라고 부릅니다. 즉, 기계 내부에서는 활성화되어 일을 하고 있지만, 외부 세계에는 완전히 보이지 않는 표현을 말합니다.
이것이 단순한 우연이 아님을 증명하기 위해, 연구진은 공장을 고장 내는 실험을 했습니다. 그들은 특정 "채널"(유령 신호를 운반하는 전선)을 찾아내어 이를 잘라냈습니다(이를 '절제(ablation)'라고 합니다). 이 착각에 민감한 전선들을 잘라냈을 때, 내부 신호는 거의 44%나 감소했습니다. 이는 이 특정 전선들이 실제로 착각을 운반하고 있었음을 입증했습니다. 하지만 핵심은 이것입니다. 이 전선들을 잘랐을 때 최종 이미지는 거의 변하지 않았습니다. 사실, 이 "착각" 전선을 자르는 것이 무작위로 전선을 자르는 것보다 최종 사진을 더 안정적으로 만들었습니다. 마치 공장에 스스로를 교정하는 메커니즘이 있어서, 유령을 포착하여 최종 제품을 망치기 전에 조용히 삭제하는 것과 같습니다.
유령이 존재하는 이유
연구진은 또한 이것이 특정 AI 구조의 특징인지, 아니면 모델이 학습되는 방식에 관한 것인지 알고 싶었습니다. 그들은 "디노이징(denoising)" 모델(노이즈를 제거하도록 훈련된 모델)과 "판별(discriminative)" 모델(이미지가 고양이인지 개인지 등을 인식하도록 훈련된 모델)을 비교했습니다.
결과는 명확했습니다. 유령은 디노이징 모델에서만 나타났습니다. 판별 모델은 설령 동일한 공장 구조를 가지고 있더라도 강한 착각 신호를 보이지 않았습니다. 이는 이미지를 재구성하거나 정제하려는 행위 자체가 AI가 인간처럼 이러한 착각을 발달시키도록 강제한다는 것을 시사합니다. 마치 훈련 과정이 AI에게 인간처럼 맥락과 주변 환경에 주의를 기울이도록 가르치지만, AI의 자체적인 내부 규칙은 이 맥락이 최종 출력물에는 영향을 주어서는 안 된다고 결정하는 것과 같습니다.
이 연구는 DiT-XL/2라는 거대한 모델을 포함한 다양한 유형의 AI도 살펴보았습니다. 이 거대한 모델에서도 착각 신호는 중간 레이어에서 정점을 찍었지만 끝부분에 도달하면 사라졌습니다. 연구진은 AI의 자기 교정 역학, 즉 자신의 작업을 재검토하는 방식이 유령을 사라지게 만드는 이유라고 밝혔습니다. 이는 마치 AI에게 엄격한 편집자가 있어서, "아니, 그 밝기는 여기에 어울리지 않아"라고 말하며 이야기가 출판되기 전에 내용을 지워버리는 것과 같습니다.
시사점
그렇다면 이 모든 것이 무엇을 의미할까요? AI 모델은 단순히 인간의 행동을 흉내 내는 것이 아니라, 내부적으로 인간의 지각과 유사한 경험을 하고 있다는 것이 밝혀졌습니다. AI는 우리가 가진 편향을 포함하여, 시각적 트릭에 대한 풍부하고 상세한 이해를 구축합니다. 하지만 우리와 달리, AI는 이러한 편향이 최종 출력물에 영향을 미치지 못하도록 막는 필터를 가지고 있는 듯합니다.
이 발견은 마치 로봇이 하늘을 나는 생생한 꿈을 꾸었지만, 잠에서 깨어나 집을 지을 때는 완벽하게 평범하고 현실적인 집을 짓는 것을 발견한 것과 같습니다. 꿈은 로봇에게 실재했지만, 그것이 집에 영향을 주지는 않았습니다. 연구진은 이러한 "지각적 환영" 현상이 많은 AI 시스템에서 흔히 나타날 수 있다고 제안합니다. 이는 우리가 AI가 생산하는 결과물만을 본다면, AI가 실제로 무엇을 알고 있고 어떻게 생각하는지에 대한 거대한 부분을 놓치고 있을 수도 있음을 의미합니다. AI는 우리가 볼 수 없는 것을 보고 있을 수도 있으며, 비록 그것을 우리에게 보여주지 않더라도 말입니다.
이 연구는 단순히 제안하는 데 그치지 않고, 이를 측정하고, 전선을 잘라 증명하며, 신호를 주입하여 테스트했습니다. 연구진은 9개의 서로 다른 모델에 걸쳐 착각 신호가 강력하고 인과적이지만, 출력에서는 완전히 사라진다는 것을 확인했습니다. 이는 AI의 세계에서 보이는 것이 항상 얻는 것은 아니며, 때로는 가장 흥anche한 것은 기계 안에 숨겨진 채 남아있는 유령이라는 사실을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.