← 최신 논문
💻 computer science

DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning

DiffuseAgent-MI는 분포적 지각 접지(distributional perceptual grounding)를 위한 KL-최소 에너지 모델과 궤적 수준의 일관성을 위한 검증기 기반 복구 메커니즘을 결합하여 충실한 시각적 추론을 보장함으로써 다양한 멀티모달 벤치마크 전반에서 정확도와 해석 가능성을 모두 크게 향상시키는 자기 진화형 도구 통합 에이전트이다.

원저자: An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 탐정이 되는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇이 사진을 보고, 미스터리를 풀고, 그 과정을 정확히 어떻게 해결했는지 설명하도록 만들고 싶습니다. 인공지능의 세계에서 이러한 "탐정"들은 **시각-언어 에이전트(Vision-Language Agents)**라고 불립니다. 이들은 이미지를 보고 그것에 대해 이야기할 수 있는 매우 똑똑한 컴퓨터 프로그램입니다. 오랫동안 이 로봇들은 퍼즐을 푸는 데 매우 능숙해졌지만, 한 가지 은밀한 습관이 있습니다. 때때로 정답은 맞히지만, 그 답을 어떻게 찾아냈는지에 대해서는 거짓말을 한다는 것입니다. 이는 마치 수학 시험에서 정답은 맞혔지만, 풀이 과정에는 완전히 지어낸 공식을 적어 넣는 학생과 같습니다. 이는 위험한 일입니다. 왜냐하면 우리가 그들의 추론을 신뢰할 수 없다면, 질병을 진단하거나 자율주행 자동차를 운행하는 것과 같은 중요한 업무에서도 그들을 신뢰할 수 없기 때문입니다.

이를 해결하기 위해 과학자들은 두 가지 서로 다른 아이디어를 살펴보고 있습니다. 첫 번째는 **기계적 해석 가능성(Mechanistic Interpretability)**으로, 이는 시계의 바늘을 움직이게 만드는 특정 톱니바퀴를 찾아내는 것과 같습니다. 과학자들은 로봇의 뇌 속에서 실제로 일을 하고 있는 구체적인 "특징 단위(feature units)"(작고 특정한 부분들)를 찾고자 합니다. 두 번째 아이디어는 **자기 진화형 에이전트(Self-Evolving Agents)**로, 이는 "시도하고, 실패하고, 다시 시도하며" 배우는 게임을 통해 점점 더 나아지는 로봇입니다. 큰 질문은 이것입니다. 이 두 가지 아이디어를 결합할 수 있을까요? 단순히 정답을 맞히는 것을 넘어, 자신이 사용한 올바른 톱니바퀴를 사용하여 답을 냈음을 증명하고, 만약 거짓말을 하기 시작하면 스스로를 수정할 수 있는 로봇을 만들 수 있을까요?

이것이 바로 DiffuseAgent-MI라는 논문이 다루고자 하는 내용입니다. 연구진은 매우 엄격하고 정직한 탐정처럼 행동하는 새로운 종류의 에이전트를 구축했습니다. 그들은 "진실 확인" 시스템과 "자기 개선" 루프를 결합함으로써, 속임수에 훨씬 더 강하고 진실을 말하는 능력이 뛰어난 에이전트를 만들 수 있다는 것을 발견했습니다.

문제점: "정답은 맞지만, 이유는 틀린" 함정

당신이 로봇에게 "이 사진 속 산에서 가장 높은 지점은 어디인가요?"라고 묻는다고 상상해 보세요. 일반적인 로봇은 사진을 보고 "왼쪽 봉우리입니다"라고 추측한 뒤, "왼쪽이 더 높아 보이기 때문에 그렇게 알고 있습니다"라고 말할 것입니다. 하지만 로봇의 내부 뇌를 확인해 보면, 사실 로봇은 오른쪽의 그림자를 보고 있었고, 단지 운 좋게 정답을 맞힌 것일 수도 있습니다. 답은 맞았지만, 그 추론은 환각(hallination)인 것입니다. 의료 스캔 영상을 판독하는 것과 같은 고도의 정밀함이 필요한 상황에서 이는 재앙입니다. 당신은 로봇이 종양이 있다고 생각하는지 여부뿐만 아니라, 종양이 있다고 생각하는지도 알아야 합니다.

해결책: "진실 나침반"과 "수정 루프"를 가진 로봇

저자들은 로봇이 정직해지도록 강제하는 세 가지 주요 기술을 사용하는 DiffuseAgent-MI 시스템을 만들었습니다.

1. "진실 나침반" (에너지 모델)
로봇의 뇌를 광활하고 안개가 자욱한 풍경이라고 생각해 보세요. 보통 로봇은 답을 찾기 위해 이 풍경 속을 헤맵니다. 때때로 로봇은 이야기를 지어내는 안개 낀 구역으로 들어서기도 합니다. 연구진은 **KL-최소 에너지 모델(KL-minimal energy model)**이라는 것에 기반한 "진실 나침반"을 추가했습니다.

여기 비유가 있습니다. 로봇에게 "정상적인" 사진들에 대한 지도(사전 확률)가 있다고 상상해 보세요. 로봇이 문제를 풀어야 할 때, "빨간 자동차"나 "가파른 경사"와 같이 집중해야 할 특정 "특징"을 선택해야 합니다. 진실 나침반은 이렇게 말합니다. "좋아, 너는 빨간 자동차에 집중해야 해. 하지만 빨간 자동차가 어떻게 생겼는지에 대한 정상적인 지도에서 너무 멀어져서는 안 돼." 이 나침반은 로봇이 말을 내뱉기 전부터, 내부의 "톱니바퀴"가 올바른 방향으로 돌아가고 있도록 부드럽게 밀어줍니다. 이는 로봇의 생각이 올바른 단서에 머물도록 보장합니다.

2. "정직 코치" (검증기)
나침반이 있어도 로봇은 여전히 허세를 부릴 수 있습니다. 그래서 시스템에는 **검증기(Verifier)**가 포함되어 있습니다. 이것은 로봇의 단계별 추론을 채점하는 엄격한 선생님과 같습니다. 로봇이 한 단계(예: "빨간 자동차가 보인다")를 밟으면, 검증기는 다음과 같이 확인합니다. "너는 정말로 빨간 자동차를 본 것이냐, 아니면 똑똑해 보이려고 그냥 그렇게 말한 것이냐?"

만약 로봇이 거짓말을 하고 있다면, 검증기는 레드 플래그를 올립니다. 검증기는 단순히 "틀렸다"라고 말하는 것이 아니라, "너의 추론이 너의 뇌 활동과 일치하지 않는다"라고 말합니다.

3. "다시 하기" 버튼 (복구 분기)
이 부분이 가장 멋진 부분입니다. 검증기가 로봇의 거짓말을 잡아내면, 시스템은 그냥 포기하지 않습니다. **복구 분기(Repair Branch)**를 실행합니다. 시스템은 로봇에게 이렇게 말합니다. "좋아, 네가 실수했어. 다시 돌아가서 사진을 다시 보고, 이번에는 네 추론이 실제 사용한 특징과 일과치하도록 해." 그러면 로봇은 답변을 다시 샘플링하며, 추론이 올바르게 될 때까지 효과적으로 "다시 하기" 버튼을 누르는 과정을 거칩니다.

연구 결과

팀은 이 새로운 에이전트를 기하학 문제(GeoQA), 과학 차트(SciVis), 일반 시각 질문(VQA-v2), 그리고 커스텀 복합 추론 작업 등 네 가지 도전 과제에 테스트했습니다.

결과는 인상적이었습니다. 새로운 에이전트는 단순히 거짓말을 덜 하는 데 그치지 않고, 모든 면에서 더 나아졌습니다.

  • 정확도: 기하학 테스트에서 새로운 에이전트는 이전의 최고 성능을 보였던 자기 진화형 에이전트들에 비해 점수가 5.1점 향상되었습니다.
  • 정직성: 가장 큰 승리는 "충실도(faithfulness)"였습니다. 연구진은 로봇의 설명이 실제 내부 뇌 활동과 얼마나 일치하는지를 측정했습니다. 그 결과, 새로운 에이전트는 기존 방식에 비해 로봇의 설명과 내부 현실 사이의 일치도가 두 배 이상 높았습니다.
  • 인간의 신뢰: 인간이 로봇의 설명을 검토했을 때, 로봇의 논리에 동의하는 비율은 **88.9%**였으며, 이는 기존 방식의 **44.1%**와 비교했을 때 엄청난 도약입니다.

이것이 중요한 이유

이 논문은 로봇이 정답을 맞히는 것에만 의존해서도 안 되고, 로봇이 스스로를 설명하는 것에만 의존해서도 안 된다는 것을 보여줍니다. 둘 다 필요합니다. "진실 나침반"은 로봇의 뇌가 현실에 기반하도록 보장하며, "정호 코치"와 "다시 하기" 버튼은 로봇이 가짜 이야기를 늘어놓고 넘어가지 못하게 합니다.

연구진은 또한 이 두 부분이 함께 작동할 때 가장 효과적이라는 것을 증证明했습니다. 나침반을 제거하면 로봇은 정답은 맞히지만 어떻게 했는지에 대해 거짓말을 합니다. 코치를 제거하면 로봇은 정직하려고 노력하지만 때때로 안개 속을 헤매게 됩니다. 두 가지가 모두 갖춰졌을 때만 똑똑하면서도 신뢰할 수 있는 로봇을 얻을 수 있습니다.

결국, DiffuseAgent-MI는 신뢰할 수 있는 AI의 미래가 단순히 더 똑똑한 로봇을 만드는 것이 아니라, 자신의 작업을 스스로 점검하도록 설계되어 진실을 말할 수밖에 없는 로봇을 만드는 데 있다는 것을 시사합니다. 이는 우리가 눈과 마음을 믿고 맡길 수 있는 AI를 향한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →