← 최신 논문
💬 NLP

ETCHR: Editing To Clarify and Harness Reasoning

이 논문은 추상적인 질문과 시각적 변환 사이의 간극을 두 단계 훈련 레시피를 통해 연결하는 분리된 추론 인식 이미지 편집 프레임워크인 ETCHR을 소개함으로써 다양한 멀티모달 대규모 언어 모델의 여러 작업 계열에 걸쳐 시각적 추론 능력을 크게 향상시킵니다.

원저자: Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin

게시일 2026-05-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 까다로운 퍼즐, 예를 들어 미로나 복잡한 차트를 풀려고 한다고 상상해 보세요. 하지만 당신은 '보는' 능력은 형편없지만 읽기는 뛰어난 스마트 어시스턴트와만 대화할 수 있습니다. "출구는 어디에 있나요?"라고 물으면 어시스턴트는 경로를 시각화할 수 없기 때문에 잘못 추측할 수 있습니다.

현재의 AI 시스템은 이를 해결하기 위해 다음 두 가지 방법 중 하나를 시도합니다:

  1. 어시스턴트에게 자와 펜을 주기: AI 에게 엄격하게 미리 작성된 명령을 사용하여 상자를 그리거나 확대하라고 지시합니다. (이는 아이에게 세 가지 색상만 있는 색칠공부를 주는 것과 같습니다. 그들은 정말로 필요한 것을 그릴 수 없습니다.)
  2. 어시스턴트에게 동시에 그리게 하고 생각하게 하기: 하나의 뇌로 두 가지 일을 하도록 시도합니다. (이는 셰프가 요리를 하면서 동시에 소설을 쓰게 하는 것과 같습니다. 음식은 종종 타버리고 이야기는 엉망이 됩니다.)

ETCHR(Editing To Clarify and Harness Reasoning, 명확화 및 추론 활용을 위한 편집) 은 이러한 문제들을 해결하는 새로운 세 번째 방법입니다. 이는 주요 AI 와 함께 작동하는 전문적인'시각 탐정'어시스턴트처럼 행동합니다.

그 작동 원리는 다음과 같이 간단한 단계로 나뉩니다:

1. 문제:'언어'와'그림'의 간극

연구진들은 일반적인 이미지 편집 도구가 수동적인 화가와 같다는 사실을 발견했습니다. "쓰레기통 주위에 빨간 상자를 그려라"라고 말하면 그들은 완벽하게 수행합니다. 하지만 "쓰레기통이 의자의 왼쪽에 있나요, 오른쪽에 있나요?"와 같은 어려운 질문을 하면 화가는 혼란에 빠집니다. 그들은 질문에 답하는 데 도움이 되도록 무엇을 그려야 할지 모릅니다.

또한, 무엇을 그려야 할지 알고 있더라도 미로를 통과하는 길고 구불구불한 경로를 따라 그리는 것과 같이 작업이 복잡하면 세부 사항을 종종 실수합니다.

2. 해결책: 2 단계 훈련 캠프

수동적인 화가를 능동적인'시각 탐정'으로 바꾸기 위해 연구팀은 ETCHR 모델을 두 단계로 훈련시켰습니다:

  • 1 단계:'모방'수업 (SFT)
    질문과 그것을 해결하는 완벽한 그림이 짝을 이루는 수천 가지 예를 화가에게 보여주는 상황을 상상해 보세요.

    • 예시: 질문:"경로는 어디에 있나요?" \rightarrow 그림: 올바른 경로를 따라 그리는 빨간 선.
    • 모델은 질문을 보고 "아, 이 질문에 답하려면 여기에 빨간 선을 그려야겠다"라고 말하도록 학습합니다. 이는 추상적인 질문을 구체적인 시각적 단서로 변환하는 법을 배우는 것입니다.
  • 2 단계:'보상'게임 (RL)
    이제 모델은 스스로 그림을 그리려고 시도합니다. 하지만 어떻게 그 그림이 실제로 도움이 되는지 알 수 있을까요?

    • 보상 A(심판): 별도의 AI 가 그림을 보고 "이 그림에 질문에 답하는 데 필요한 단서가 실제로 포함되어 있나요?"라고 묻습니다.
    • 보상 B(해결사): 주요 AI 가 그림을 사용하여 퍼즐을 해결해 봅니다. 올바른 답을 얻었나요?
    • 모델은 그림이 정확할 뿐만 아니라 실제로 문제 해결에 도움이 될 때만 점수를 받습니다. 이는 모델이'예쁘지만 쓸모없는'그림을 그리지 않도록 가르칩니다.

3. 안전망:'편집, 검증, 추론'

훈련된 탐정이라도 실수를 할 수 있습니다. 시각 탐정이 잘못된 경로를 그리면 주요 AI 를 잘못된 답으로 이끌 수 있습니다.

따라서 ETCHR 은 안전 점검을 추가합니다:

  1. 편집: 탐정이 단서를 그립니다.
  2. 검증: 주요 AI 가 멈추고 확인합니다:"이 그림이 실제로 도움이 되고 정확한가요?"
  3. 추론:
    • 예: AI 는 그림을 사용하여 퍼즐을 해결합니다.
    • 아니요: AI 는 그림을 무시하고 대신 원래 이미지로 문제를 해결하려 시도합니다.

이것이 더 나은 이유는 무엇일까요?

  • 플러그 앤 플레이: 주요 AI 를 다시 훈련시킬 필요가 없습니다. 이'시각 탐정'을 연결하기만 하면 Qwen, Gemini, Kimi 와 같은 다양한 AI 두뇌와 함께 작동합니다.
  • 유연성: 상자 그리기나 확대만 할 수 있는 도구와 달리 ETCHR 은 전체 3D 장면을 다시 그리거나, 퍼즐을 재배치하거나, 복잡한 경로를 따라 그릴 수 있습니다.
  • **정확성:'그리기'작업과'생각하기'작업을 분리함으로써 그림은 고품질을 유지하고 사고는 날카로움을 유지합니다.

결과

이 논문은 다음 다섯 가지 유형의 어려운 작업에 대해 이를 테스트했습니다:

  1. 큰 사진에서 작은 세부 사항 찾기.
  2. 복잡한 차트 읽기.
  3. 미로와 같은 논리 퍼즐 해결.
  4. 뒤섞인 퍼즐 조각을 다시 맞추기.
  5. 3D 공간 이해.

이 모든 테스트에서 ETCHR 을 추가하면 AI 가 훨씬 더 많은 질문에 올바르게 답할 수 있었습니다. 예를 들어, 특정 AI 모델의 경우 성공률이 약 **56% 에서 61%**로 상승했고, 다른 모델의 경우 **76% 에서 81%**로 증가했습니다.

요약하자면: ETCHR 은 문제를 해결하는 데 도움이 되도록 무엇을 그려야 할지 정확히 알고, 자신의 작업을 점검하며, 실제로 유용할 때만 그림을 공유하는 전용 파트너를 제공함으로써 AI 가'이미지로 생각하도록'가르칩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →