← 최신 논문
💻 computer science

Continuous Interaction Diffusion: A Diffusion-Native Runtime for Asynchronous Tool-Augmented Reasoning

이 논문은 증거 노출을 앞당기고, 도구의 지연 시간을 계산과 중첩시키며, 불필요한 외부 작업을 줄이기 위해 비동기적 도구 상호작용을 확산 언어 모델의 반복적인 디노이징 과정에 직접 통합하는 새로운 아키텍처인 연속적 상호작용 확산(Continuous Interaction Diffusion, CID)을 소개하지만, 현재는 경험적 성능 주장 없이 이론적 정식화에 초점을 맞추고 있다.

원저자: Yuhang Cao

게시일 2026-08-12
📖 5 분 읽기🧠 심층 분석

원저자: Yuhang Cao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

배경: 왜 AI에게는 새로운 사고방식이 필요한가

당신이 복잡한 미스터리를 풀려고 노력하고 있다고 상상해 보세요. 하지만 당신에게는 매우 엄격한 규칙이 하나 있습니다. 이야기를 반드시 한 번에 한 단어씩, 왼쪽에서 오른쪽으로 써 내려가야 하며, 한 번 단어를 쓰면 절대 수정할 수 없다는 규칙입니다. 만약 이야기를 쓰는 도중에 실수를 깨닫거나, 방금 쓴 내용을 완전히 바꿔버릴 새로운 단서가 등장하더라도 당신은 꼼짝달싹 못 합니다. 페이지 전체를 지우고 처음부터 다시 시작하거나, 맨 끝에 어색하게 "수정 사항"을 덧붙이는 방법뿐입니다. 이것이 현재 대부분의 AI 모델이 작동하는 방식입니다. 이들은 마치 앞으로만 나아갈 수 있을 뿐, 결코 뒤로 돌아갈 수 없는 작가와 같습니다.

이제 다른 종류의 작가를 상상해 보세요. 이 작가는 이야기 전체의 흐릿하고 엉성한 스케치에서 시작합니다. 이들은 단어 하나하나를 써 내려가는 대신, 전체 그림을 바라보며 서서히 세부 사항을 선명하게 다듬어 나갑니다. 만약 새로운 단서가 도착하면, 이들은 즉시 스케치의 흐릿한 부분을 찾아내어 수정하고, 종이를 찢어버리는 일 없이 그 내용을 나머지 이미지와 자연스럽게 섞어 넣을 수 있습니다. 이것이 "확산(diffusion)" 모델이 작동하는 방식입니다. 이들은 아이디어를 벽돌을 쌓듯 하나씩 만드는 것이 아니라, 한 번에 전체 아이디어를 정교하게 다듬어 나갑니다.

과학자들이 던지는 핵심 질문은 이것입니다. 어떻게 하면 이 "정교화하는(refining)" AI 모델들이 (인터넷 검색이나 파일 읽기 같은) 도구를 사용하면서도, 흐름을 끊기 위해 멈춰서 기다리게 하지 않을 수 있을까? 만약 어떤 도구가 답변을 주는 데 5초가 걸린다면, 표준적인 AI는 그저 벽을 바라보며 멍하니 서 있게 됩니다. 하지만 정교화하는 AI는 그 5초 동안 이야기의 다른 부분들을 작업하며 바쁘게 움직일 수 있습니다. 과제는 새로운 정보가 들어왔을 때, AI가 생각하는 도중에 흐름을 깨뜨리지 않고 어떻게 그 정보를 이야기 속으로 다시 밀어 넣을 것인가 하는 것입니다. 이것이 바로 이 논문이 다루는 퍼즐입니다.

논문: AI가 세상과 대화하는 새로운 방법

이 논문은 **연속적 상호작용 확산(Continuous Interaction Diffusion, CID)**이라는 새로운 시스템을 소개합니다. 이것을 "선형적 작가"라기보다는 "영원한 편집자"로 설계된 AI를 위한 새로운 이론적 청사진이라고 생각하면 됩니다.

기존 방식에서 AI는 생각하다가, 멈추고, "웹 검색이 필요해!"라고 외친 뒤, 답변을 기다리고, 답변을 읽고 나서 다시 생각을 시작했습니다. 이는 '가다 서다'를 반복하는 과정입니다. 저자는 이러한 방식이 전체 출력을 병렬적으로 계속 수정하도록 설계된 확산 모델에는 형편없는 궁합이라고 주장합니다. 확산 모델에게 정보를 기다리는 동안 멈추라고 명령하는 것은, 화가에게 새로운 색을 섞어야 할 때마다 손을 멈추고 얼어붙으라고 말하는 것과 같습니다.

CID는 AI의 두뇌를 서로 협력하지만 서로 다른 규칙을 가진 세 가지 뚜로 된 "채널"로 분리함으로써 해결책을 제시합니다.

  1. 사실 채널 (불변의 장부 - The Immutable Ledger): 이곳은 AI가 외부 세계로부터 정보(예: 검색 결과나 파일)를 읽을 수 있는 특별한 공책입니다. 하지만 AI는 이를 지우거나 변경할 수 없습니다. 만약 현실 세계가 "하늘은 파랗다"라고 말한다면, 이 채널은 그 진실을 안전하게 보관할 것입니다. 설령 AI 자신의 생각이 혼란에 빠져 "하늘은 초록색이다"라고 말하려 하더라도, 사실 채널은 진실을 지켜낼 것입니다. 이것은 유리 케이스와 같습니다. 내부의 증거를 볼 수는 있지만, 건드릴 수는 없습니다.
  2. 사고 채널 (찰흙 모델 - The Clay Model): 이곳은 AI의 실제 사고가 일어나는 곳입니다. 이것은 단순한 텍스트가 아니라, "타입형 인지 텐서(Typed Cognitive Tensor)"라는 것인데, 이는 쉽게 말해 아이디어들의 유연한 3D 찰흙 모델을 의미합니다. AI는 이 찰흙을 빚고, 짓누르고, 늘리고, 모양을 바꿀 수 있습니다. 새로운 증거가 도착하면, AI는 즉시 찰흙의 모양을 바꾸어 새로운 진실에 맞게 조정할 수 있습니다. 이것은 딱딱한 텍스트의 줄이 아니라, 살아 움직이는 작업 공간입니다.
  3. 디스플레이 채널 (최종 완성본 - The Final Painting): 이것은 인간 사용자가 실제로 보게 될 최종 버전의 이야기입니다. AI는 "찰흙 모델(사고)"을 계속 작업하고 "유리 케이스(사실)"를 확인하는 동안, "최종 완성본(디스플레이)"을 점점 더 선명하게 만들어 나갈 수 있습니다.

CID의 마법은 **지속적 지각 결합(Persistent Perceptual Bindings)**이라는 기능입니다. 당신이 케이크를 굽고 있고 오븐이 예열되었는지 확인해야 한다고 상상해 보세요. 기존 시스템에서는 베이킹을 멈추고, 오븐으로 달려가서, 확인하고, 돌아와서, 무엇을 할지 결정해야 합니다. CID에서 AI는 오븐에 주의력을 "결합(bind)"합니다. AI는 "오븐을 확인하라"라는 명령을 다 쓰기도 전에 이미 오븐을 확인하기 시작합니다. 오븐이 가열되는 동안(도구가 작동하는 동안), AI는 계속해서 반죽을 섞습니다(생각의 다른 부분을 정교화합니다). 오븐이 준비되면, 그 결과는 즉시 찰흙 모델로 투영됩니다. AI는 멈출 필요가 없습니다. 그저 진행 중인 작업 속에 새로운 정보를 매끄럽게 섞어 넣을 뿐입니다.

또한 이 논문은 AI가 정확히 어떻게 요청할지 알기 전에, 무엇이 필요한지를 먼저 알 수 있는 방법을 소개합니다. 이것은 마치 사과인지 딸기인지 결정하기 전에 "빨간 과일"이 필요하다는 것을 먼저 아는 것과 같습니다. 시스템은 즉시 "빨간 과일"을 찾기 시작하여 소중한 시간을 절약할 수 있습니다.

이 논문이 실제로 말하는 것 (그리고 말하지 않는 것)

이 논문이 실제로 무엇을 달성했는지 이해하는 것이 중요합니다. 저자는 이 새로운 시스템을 위한 상세한 공식 제안과 수학적 프레 framework를 구축했습니다. 그들은 세 채널이 어떻게 작동해야 하는지, AI를 어떻게 훈련시켜야 하는지, 그리고 그것이 잘 작동하는지 어떻게 측정할지를 정확하게 정의했습니다.

하지만 이 논문은 이 시스템이 이미 구축되었거나, 실행 중이거나, 문제를 해결하는 데 최고라고 주장하지 않습니다. 사실, 저자는 이것이 이 주제에 관한 첫 번째 논문이며, 아직 어떠한 경험적 성능 주장도 하지 않는다고 명시적으로 밝히고 있습니다. 그들은 이 시스템이 기존 시스템보다 낫다는 것을 증명하기 위한 대규모 테스트를 아직 수행하지 않았습니다. 그들은 "여기에 더 나은 엔진을 설계하는 새로운 방법이 있고, 우리가 생각하는 작동 방식이 있지만, 이를 증명하기 위해서는 자동차를 만들고 직접 운전해 보아야 한다"라고 말하고 있는 것입니다.

그들은 이 접근 방식이 정보를 가져오는 시간과 생각하는 시간을 겹치게 함으로써 AI를 더 빠르고 정확하게 만들 수 있다고 제안합니다. 그들은 기존의 "멈춰서 기다리는" 방식이 AI로 하여금 충분한 정보가 없는 상태에서 결정을 내리게 만들어 실수를 유발한다고 주장합니다.

또한 논문은 몇 가지 사항을 배제합니다. 단순히 기존 AI를 "비동기적(asynchronous)"으로 만드는 것(즉, 기다리는 동안 다른 일을 하게 하는 것)만으로는 기존의 구조가 여전히 경직되어 있다면 충분하지 않다고 말합니다. AI가 정보를 처리하는 방식(확산 과정) 자체가 새로운 정보를 즉각적으로 다룰 수 있도록 변해야 합니다. 또한, 이 첫 번째 버전은 "읽기 전용" 도구(검색이나 파일 읽기 등)만을 다루며, 세상에 변화를 주는 도구(이메일을 보내거나 파일을 삭제하는 등)는 훨씬 더 복합적인 안전 규칙이 필요하기 때문에 다루지 않는다고 명시했습니다.

요약하자면, 이 논문은 AI가 단순히 "묻고 기다리는" 것이 아니라, "묻고, 계속 작업하며, 답을 매끄럽게 통합하는" 혁신적인 구조를 제안합니다. 이는 유망한 새로운 방향이지만, 그 힘에 대한 진짜 증명은 여전히 실험실에서의 테스트를 기다리고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →