← 최신 논문
🤖 AI

Deep Interaction: An Efficient Human-AI Interaction Method for Large Reasoning Models

이 논문은 사용자가 대규모 언어 모델의 오류가 있는 추론 단계를 직접 수정하고 교정된 사고 사슬(Chain-of-Thought)을 프롬프트로 증류할 수 있게 하여, 기존 방식 대비 교정 성공률은 25% 높이고 토큰은 40% 절감하는 효율적인 인간-AI 상호작용 방법인 "Deep Interaction"을 소개한다.

원저자: Hefeng Zhou, Jinxuan Zhang, Jiong Lou, Yuxin Liu, Chaochao Lu, Jingjing Qu, Jie Li

게시일 2026-07-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hefeng Zhou, Jinxuan Zhang, Jiong Lou, Yuxin Liu, Chaochao Lu, Jingjing Qu, Jie Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 똑똑하지만 약간 고집스러운 로봇에게 까다로운 퍼즐을 푸는 법을 가르치려 한다고 상상해 보세요. 이 로봇은 거의 모든 인터넷 정보를 읽었으며 이야기를 쓰고, 수학 문제를 풀고, 심지어 사람처럼 행동할 수도 있는 인공지능의 한 종류인 거대 언어 모델(LLM)입니다. 이 로봇들이 더 잘 생각할 수 있도록 돕기 위해, 과학자들은 "사고의 사슬(Chain-of-Thought, CoT)"이라는 기술을 발명했습니다. CoT를 로봇에게 단순히 답을 추측하는 대신, 마치 학생이 수학 숙제를 적을 때처럼 자신의 풀이 과정을 단계별로 소리 내어 "풀이 과정을 보여달라고" 요청하는 것으로 생각하면 됩니다. 이는 로봇이 복잡한 작업을 수행하는 데 훨씬 더 똑똑해지도록 만들었습니다.

하지만 문제가 하나 있습니다. 때때로 로봇이 10단계 계획 중 3단계에서 실수를 저지르곤 합니다. 기존 방식에서는 로봇에게 "이봐, 3단계가 틀렸어"라고 대화하며 말하고, 로봇이 그 말을 듣기를 바랄 수밖에 없었습니다. 하지만 종종 로봇은 "맞습니다, 제가 실수했습니다"라고 대답하면서도, 곧바로 다음 단계에서 정확히 똑같은 실수를 반복하거나, 혼란에 빠져 나머지 계획을 잊어버리곤 합니다. 이는 마치 친구가 길을 잘못 가고 있을 때 뒤에서 소리를 질러 교정하려는 것과 같습니다. 친구가 당신의 목소리는 들었을지 몰라도, 계속해서 제자리를 맴돌며 걷는 것과 마찬가지죠. 이러한 현상은 과학 문제를 해결하거나 안전 로직을 점검하는 것과 같은 진지한 업무에 AI를 사용하려는 사람들에게 매우 좌절감을 줍니다.

여기서 **딥 인터랙션(Deep Interaction)**이라는 새로운 아이디어가 등장합니다. 이 방법은 로봇과 단순히 대화를 나누는 대신, 컴퓨터에서 문서를 편집하듯이 로봇의 "사고 과정"을 직접 수정하는 것을 제안합니다. 로봇이 이야기를 쓰고 있다면, 당신이 틀린 문장을 하이라이트하고, 삭제하고, 그 자리에 올바른 문장을 바로 타이핑하는 모습을 상상해 보세요. 시스템은 당신이 편집한 버전을 가져와서 내용을 정리하고, 로봇에게 그 수정된 지점부터 이야기를 계속하도록 요청합니다. 연구진은 이 "직접 편집" 방식이 기존의 "대화하고 희망하기(chat and hope)" 방식보다 훨씬 빠르고 정확하다는 것을 발견했습니다. 이들은 어려운 과학 및 수학 문제에 대한 테스트에서, 이 새로운 방식이 교정 성공률을 (기존 방식 대비 상대적으로) 25% 이상 향상시켰으며, 정답을 맞힌 질문들에 대해 기존 방식보다 토큰 사용량을 약 40% 줄였다고 밝혔습니다.

"그냥 대화하기"의 문제점

AI 모델이 실수를 할 때, 일반적인 해결책은 대화를 나누는 것입니다. 당신은 AI에게 "그 단계는 틀렸어"라고 말하고, AI는 다시 시도합니다. 하지만 이 논문은 이 방식이 자주 실패한다는 것을 보여줍니다. AI는 자신이 틀렸다는 것에 동의할 수는 있지만, 그러면 루프에 빠져 똑같은 오류를 반복하거나, 똑같이 틀린 새로운 경로로 벗어나 버립니다. 이는 마치 GPS가 계속 "경로를 재탐색 중입니다"라고 말하면서도, 결국 당신을 다시 교통 체증이 있는 곳으로 보내버리는 것과 같습니다. 저자들은 이것이 AI가 전체 대화 기록을 기억하려고 애쓰느라 과정이 엉망이 되거나, 논리를 진정으로 이해하기보다는 훈련 데이터의 패턴을 단순히 암기하기 때문에 발생한다고 주장합니다.

해결책: "생각"을 편집하기

저자들은 딥 인터랙션이라는 시스템을 제안하며, 이는 AI의 추론 단계를 초안 문서처럼 취급합니다. 작동 방식은 다음과 같습니다:

  1. 초안: AI가 사고의 사슬(Chain-of-Thought, 단계별 추론)을 포함한 솔루션을 생성합니다.
  2. 편집: 만약 실수를 발견했다면, 채팅창에 메시지를 입력하는 것이 아닙니다. 대신, AI의 추론 텍스트를 직접 편집합니다. 잘못된 단계를 삭제하거나, 숫자를 바꾸거나, 논리적 공백을 메우는 등, 마치 워드 프로세서에서 "변경 내용 추적" 기능을 사용하는 것처럼 할 수 있습니다.
  3. 정리: 시스템은 당신이 무엇을 변경했는지 파악할 만큼 똑똑합니다. 당신의 편집 사항을 강조 표시하고, 삭제된 부분을 제거하며, 혼란스러운 잔여 텍스트를 정리합니다. 또한 AI가 이전의 틀린 숫자를 단순히 암기하지 못하도록 특정 숫자를 마스킹(masking) 처리합니다.
  4. 재시작: 시스템은 당신이 편집한 버전을 가져와 AI에게 새로운 지침으로 전달합니다: "여기까지 수정된 경로가 있습니다. 이 지점부터 계속 진행해 주세요."

연구 결과

연구진은 고등학교 및 대학교 수준의 수학, 물리학, 화학, 생물학 문제를 포함한 매우 어려운 문제들로 이 방법을 테스트했습니다. 그들은 이 "딥 인터랙션" 방식을 표준적인 "채팅 기반" 교정 방식과 비교했습니다.

  • 더 높은 성공률: 새로운 방식은 단순히 대화하는 방식에 비해 교정 성공률을 25% 이상 향상시켰습니다. 예를 들어, 어려운 과학 질문 세트에서 표준 채팅 방식은 몇 번의 시도 끝에 약 72%의 정답률을 보였지만, 딥 인터랙션은 약 86%의 정답률을 기록했습니다.
  • 더 빠르고 저렴함: AI가 길고 엉망인 대화 기록을 다시 읽을 필요가 없기 때문에, 결국 정답을 맞힌 질문들에 대해 약 40% 더 적은 토큰(AI가 처리하는 텍스트 단위)을 사용했습니다. 이는 과정을 훨씬 더 효율적으로 만듭니다.
  • 다양한 모델에 적용 가능: 이들은 작은 모델부터 매우 큰 모델에 이르기까지 여러 가지 AI 모델을 대상으로 테스트했습니다. 모든 경우에서, 추론 단계를 직접 편집하는 능력이 단순히 대화하는 것보다 모델의 성능을 높이는 데 도움이 되었습니다.

이것이 중요한 이유

이 논문은 AI가 정밀함을 요구하는 복잡한 작업(예: 수학 방정식을 풀거나 안전 시나리오를 분석하는 일)을 수행할 때, 단순히 대화하는 것만으로는 충분하지 않다고 시사합니다. 우리는 AI의 생각을 직접 "조종(steer)"할 수 있는 방법이 필요합니다. 인간이 추론 단계를 편집할 수 있게 함으로써, 우리는 "맞습니다, 제가 실수했습니다"라는 말 뒤에 똑같은 실수를 반복하는 루프에 빠지지 않고 AI를 잘못된 길에서 벗어나도록 안내할 수 있습니다.

저자들은 이 방법이 인간이 오류를 찾아낼 수 있다는 점에 의존한다는 점을 언급합니다. 만약 인간이 무엇이 잘못되었는지 모른다면, 고칠 수도 없습니다. 또한, 만약 인간이 AI에게 잘못된 교정안을 준다면, AI는 그 잘못된 경로를 따를 수도 있습니다. 하지만 학생, 교사 또는 전문가와 같이 해당 분야를 알고 있는 사용자들에게 이 "딥 인터랙션"은 AI와 협업하는 강력한 새로운 방법을 제공하며, 좌절스러운 대화를 생산적인 편집 세션으로 바꿔줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →