← 최신 논문
💻 computer science

From Intermediate States to Novel Outcomes: Intervention-Sensitive Visual Process Grounding in an Artificial Cognitive System

이 논문은 인공 인지 시스템이 새로운 결과를 달성하기 위해 개입에 민감한 시각적 과정 규칙(서로 다른 중간 상태를 구별하는 것)을 추론하고 적용할 수 있음을 입증하며, 종단점만을 활용한 대조군보다 성능이 현저히 뛰어나고, 직접적인 개입 감독 없이도 중간 이미지 치환에 의해 명시적인 과정 코드가 역전될 수 있음을 보여주는 언어 불필요 과업을 소개한다.

원저자: Tomoki Saka

게시일 2026-08-06
📖 5 분 읽기🧠 심층 분석

원저자: Tomoki Saka

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

탐정의 딜레마: 왜 "무엇"보다 "어떻게"가 더 중요한가

당신이 마술을 보고 있다고 상상해 보세요. 마술사가 빨간 공으로 시작해서, 몇 가지 신비로운 동작을 한 뒤, 테이블 위에 파란 공을 놓으며 끝을 맺습니다. 만약 당신이 시작과 끝만 보았다면, "그래, 빨간색이 파란색으로 변했구나"라고 생각할지도 모릅니다. 하지만 만약 마술사가 동작의 순서를 다르게 했다면 어떨까요? 아마도 공을 테이블 위로 굴리기 전에 파란색으로 칠했을 수도 있고, 혹은 빨간 공을 먼저 굴린 후에 색을 칠했을 수도 있습니다. 만약 당신이 새로운 무대에서 새로운 공으로 이 마술을 재현하려 한다면, 그 순서가 모든 것을 바꿀 것입니다. 먼저 색을 칠했다면, 공은 먼저 굴렸을 때와는 다르게 굴러갈 수도 있기 때문입니다.

이것이 인공지능(AI)의 매혹적인 문제의 핵심입니다. 오랫동안 컴퓨터는 "무엇"을 인식하는 것—즉, 사진 속에 고양이나 자동차가 들어있다는 것을 식별하는 것—에는 뛰어난 모습을 보여왔습니다. 하지만 컴퓨터는 종종 "어떻게"—그 물체가 그곳에 도달하게 된 일련의 단계들—를 이해하는 데 어려움을 겪습니다. 이 논문은 **시각적 프로세스 제어(visual process control)**라는 AI의 특정 영역을 깊이 파고듭니다. 이 연구는 단순하지만 까다로운 질문을 던집니다. 만약 AI가 시작과 끝을 본다면, 그 변화가 어떻게 일어났는지를 설명하는 숨겨진 중간 단계를 찾아낼 수 있을까요? 그리고 더 중요한 것은, 만약 그 숨겨진 중간 단계를 바꾼다면 AI가 다음에 할 행동에 대해 생각을 바꿀까요? 연구자들은 단순히 정답을 암기하는 것이 아니라, 재료가 바뀌었을 때 새로운 요리를 만들어낼 수 있도록 '레시피'를 실제로 이해하는 시스템을 구축하고자 했습니다.

"중간 단계"라는 마술의 속임수

이 연구에서 도쿄 전기 대학의 사카 토모키(Tomoki Saka)라는 연구자는 이 아이디어를 테스트하기 위한 디지털 놀이터를 만들었습니다. 이것은 마치 색깔이 있는 도형들이 격자 위에 놓인 비디오 게임 레벨과 같습니다. 이 게임에는 물체를 움직이는 두 가지 규칙이 있습니다:

  1. 색상 우선 규칙 (The Color-First Rule): 특정 도형의 색을 먼저 바꾼 다음, 그 새로운 색을 가진 모든 객체를 이동시킵니다.
  2. 이동 우선 규칙 (The Move-First Rule): 특정 색을 가진 모든 객체를 먼저 이동시킨 다음, 대상 도형의 색을 바꿉니다.

여기 반전이 있습니다. 연구자들은 시작 그림과 끝 그림이 동일하더라도 두 규칙이 기술적으로 모두 작동할 수 있도록 게임을 설정했습니다! 시작과 끝은 똑같아 보입니다. 유일한 차이점은 어떤 규칙이 실제로 사용되었는지를 보여주는 단 하나의 "중간 프레임"(D1이라고 불림)뿐입니다.

목표는 AI에게 그 중간 프레임을 보고 어떤 규칙이 사용되었는지 파악한 다음, 그 규칙을 새로운 퍼즐에 적용하도록 가르치는 것이었습니다. 이는 마치 학생에게 수학 문제를 보여주는데, 정답은 보이지만 그 방법론에 대한 유일한 단서는 페이지 중간에 적힌 단 하나의 낙서뿐인 상황과 같습니다. 만약 학생이 그 낙서를 읽을 수 있다면, 새로운 문제를 풀 수 있습니다. 만약 읽지 못한다면, 그저 추측하는 것에 불과합니다.

거대한 발견: 지름길을 쓰라고 배우지 않고도 학습하기

이 논문에서 가장 흥적인 부분은 연구자들이 AI를 "지름길 없는" 모드로 테스트했을 때 일어난 일입니다. 그들은 AI에게 규칙을 정상적으로 학습하도록 수천 개의 사례를 통해 훈련시켰습니다. 중간 프레임이 바뀌었을 때 어떻게 대응해야 하는지에 대한 특별한 기술을 가르치지 않았습니다. 그저 자연스러운 패턴을 학습하도록 내버려 두었습니다.

그런 다음, 그들은 테스트 중에 기막힌 수를 썼습니다. AI가 한 번도 본 적 없는 퍼즐을 가져온 뒤, 중간 프레임을 반대되는 규칙의 것으로 바꿔치기했습니다. 예를 들어, AI에게 "색상 우선" 규칙을 따르는 것처럼 보이는 퍼즐을 보여주면서, 몰래 "이동 우선" 예시의 중간 프레임을 끼워 넣은 것입니다.

결과는 놀라웠습니다. AI가 이 교체에 대해 명시적으로 배운 적이 없음에도 불구하고, AI는 즉시 생각을 바꾸었습니다. AI는 새로운 중간 프레임을 보고, "아, 이것은 사실 '이동 우선' 퍼즐이구나!"라고 깨달은 뒤 올바른 새로운 결과를 만들어냈습니다.

수치 또한 놀라운 정밀도로 이를 뒷받침합니다. AI가 중간 단서(종착점 제어) 없이 추측하도록 강요되었을 때, AI는 기본적으로 동전 던지기를 하는 것과 같았으며 약 50%의 확률로만 정답을 맞혔습니다. 하지만 중간 프레임을 볼 수 있게 되자, IoU(Intersection over Union)라는 지표로 측정했을 때 **98.1%**의 확률로 이미지를 정확히 구현해 냈습니다. 더욱 인상적인 것은, 연구자들이 중간 프레임을 바꿨을 때 AI가 대안적인 결과로 전환할 확률이 0.99988이었다는 점입니다. 이는 거의 100%에 가깝습니다. 그것은 단순한 추측이 아니라, 과정의 "레시피"를 진정으로 읽는 법을 배운 것이었습니다.

"불확실성"의 서프라이즈

연구자들은 또 다른 것도 테스트했습니다. 만약 중간 프레임을 아예 숨겨버리면 어떻게 될까요? 현실 세계에서는 때때로 모든 단서를 가질 수 없습니다. 똑똑한 시스템이라면 자신 있게 틀린 답을 내놓는 대신 "모르겠다"라고 말할 수 있어야 합니다.

그들은 AI가 자연스럽게 "모르겠다"라고 말하는 법을 배우지 못했다는 것을 발견했습니다. 중간 프레임이 비어 있을 때조차도, AI는 여전히 매우 확신에 차서 한쪽 답을 선택하거나 다른 쪽 답을 높은 확신도로 골랐습니다. AI가 불확실해지는 법(즉, "확실하지 않다"라고 말하는 법)을 배우려면, 연구자들이 훈련 과정에서 명시적으로 불확실성을 가르쳐야만 했습니다. 이는 매우 중요한 발견입니다: 단계를 이해한다고 해서, 자신이 단계를 놓치고 있다는 사실까지 자동으로 알게 되는 것은 아닙니다. AI는 누락된 정보를 처리하는 법을 배우기 위해 구체적인 수업이 필요했습니다.

"비밀 코드" vs "열린 책"

마지막으로, 팀은 AI가 스스로에게 소통하는 두 가지 방식을 비교했습니다.

  1. 열린 책 (명시적 인터페이스 - Explicit Interface): AI가 "규칙 A" 또는 "규칙 B"와 같이 간단한 메모를 작성합니다. 이는 인간이 읽고 이해하기 쉽습니다.
  2. 비밀 코드 (잠재적 인터페이스 - Latent Interface): AI가 오직 컴퓨터만이 이해할 수 있는 복잡하고 보이지 않는 숫자 스트림을 사용합니다.

"비밀 코드" 버전이 정답을 맞히는 데 있어 약간 더 나은 성능(정확도에서 약 0.008 포인트 높음)을 보였습니다. 그러나 "열린 책" 버전 역시 매우 뛰어난 성능(98.1% 정확도)을 보여주었으며, 이해 가능하다는 큰 장점을 가지고 있었습니다. 연구자들은 비밀 코드가 아주 미세한 우위를 점하긴 하지만, 단순하고 읽기 쉬운 메모만으로도 문제를 거의 완벽하게 해결하기에 충분하다는 결론을 내렸습니다.

이것이 미래에 의미하는 바

이 논문은 인간의 감정이나 현실 세계의 물리학을 이해하는 로봇을 만들었다고 주장하는 것이 아닙니다. 이 연구는 도형과 색상을 이용한 매우 단순하고 인위적인 세계를 사용했습니다. 하지만 이 연구는 강력한 점을 증명했습니다: AI가 단순히 "무엇"을 넘어 과정의 "어떻게"에 민감해질 수 있다는 것입니다.

이 연구는 만약 중간 단계를 살펴보도록 시스템을 설계한다면, 그 지식을 새로운 상황에 일반화할 수 있으며, 심지어 그 단계들을 바꿔치기하여 속이더라도 그렇다는 것을 보여주었습니다. 또한 우리는 주의해야 한다는 점도 보여주었습니다. AI가 어떤 과정을 학습했다고 해서, 정보가 누락되었을 때 그것을 인지한다는 뜻은 아닙니다.

요약하자면, 이 연구는 단순히 게임의 최종 점수를 암기하는 것이 아니라, 승리하기 위해 사용된 전략을 실제로 이해하는 AI를 구축하는 방향으로 나아가는 한 걸음입니다. 그리고 그것은 기계가 배우기에 꽤 멋진 기술입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →