Self-Evolving Code-with-Image Reasoning
이 논문은 멀티모달 모델이 복잡한 픽셀 수준의 과제를 해결하기 위해 시각적 알고리즘을 코드로 구현하는 학습 불필요(training-free) 자기 진화 프레임워크인 "Code-with-Image"를 소개하며, 이는 실행 가능한 성찰 루프를 사용하여 추론 능력을 반복적으로 정교화하고 CwI-Bench에서 상당한 성능 향상을 달성한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
탐정의 딜레마: 보는 것만으로는 충분하지 않을 때
당신이 미스터리를 풀려는 탐정이라고 상상해 보세요. 하지만 단서를 찾는 대신, 고해상도 사진 한 장을 뚫어지게 쳐다보고 있습니다. 인공지능의 세계에서 '멀티모달 모델(multimodal models)'이 하는 일이 바로 이것입니다. 이미지를 보고 그에 대한 질문에 답하는 것이죠. 오랫동안 이 AI 탐정들은 '도구'를 사용하는 법을 배우며 발전해 왔습니다. 단서가 너무 작아 보이지 않으면, 확대하는 법을 배웁니다. 텍스트가 흐릿하면, 이미지를 밝게 만드는 법을 배웁니다. 이것을 '이미지로 생각하기(thinking with images)'라고 부릅니다. 마치 탐정에게 돋보기와 손전등을 쥐여주는 것과 같습니다.
하지만 함정이 있습니다. 어떤 미스터리는 단순히 더 열심히 본다고 해서 해결되지 않습니다. 특정 패턴에 포함된 픽셀의 개수를 정확히 세어야 하거나, 숨겨진 반지가 정확히 몇 도 회전했는지 알아내야 하는 퍼즐을 상상해 보세요. 아무리 확대하거나 밝기를 조절해도 눈으로는 정답을 '볼' 수 없습니다. 당신은 그것을 계산해야 합니다. 여기서 기존의 사고방식은 벽에 부딪힙니다. AI는 퍼즐을 푸는 단계를 말로 설명할 수는 있지만, 말은 그림을 대상으로 수학을 할 수 없습니다. 이 논문은 그 간극을 파고들며, 단순하지만 심오한 질문을 던집니다. "만약 AI가 솔루션을 단순히 설명하는 것을 넘어, 솔루션을 실행할 컴퓨터 프로그램을 직접 작성한다면 어떨까?"
논문의 핵심 아이디어: 사고로서의 코딩
이 논문은 Code-with-Image라고 불리는, AI가 시각적 퍼즐을 해결하는 새로운 방식을 소개합니다. AI에게 단순히 이미지를 "보고" 답을 추측하게 하거나, "자르기(crop)" 또는 "회전(rotate)" 같은 미리 만들어진 도구 목록을 사용하는 대신, 연구진은 AI에게 빈 캔버스와 파이썬 인터프리터(컴퓨터 코드를 실행하는 도구)를 제공합니다. AI의 임무는 정답을 찾기 위해 이미지의 픽셀을 직접 조작하는 프로그램을 작성하는 것입니다.
이렇게 생각해 보세요. 예전 방식에서 만약 당신이 AI에게 "이 사진에 빨간 점이 몇 개 있나요?"라고 묻는다면, AI는 점들을 묘com사하거나 그것들을 강조하는 도구를 사용하려 할 것입니다. 하지만 Code-with-Image에서 AI는 "모든 픽셀을 훑으며, 해당 픽셀이 빨간색인지 확인하고, 개수를 센 뒤, 총합을 출력하라"는 스크립트를 작성해야 합니다. 프로그램이 곧 추론입니다. 코드가 맞으면 답도 맞고, 코드가 틀리면 답도 틀립니다. 이는 과제를 '보는 것'에서 '만드는 것'으로 전환시킵니다.
문제점: 설명은 할 수 있지만, 실행은 못 한다
연구진은 가장 똑똑한 AI 모델들조차 이 문제로 고군분투한다는 것을 발견했습니다. 그들은 30가지 유형의 시각적 퍼즐이 포함된 CwI-Bench(Code-with-Image Bench)라는 거대한 벤치마크를 테스트했습니다. 이 퍼즐들은 단순히 눈으로 봐서는 답을 얻을 수 없도록 설계되었습니다. 반드시 픽셀에 대한 다단계 계산을 수행해야만 합니다.
AI가 (심지어 '생각하기' 모드를 켠 상태에서도) 오직 글로만 이 퍼즐들을 풀려고 했을 때, 결과는 처참했습니다. 예를 들어, 최상위 모델인 GPT-5.6-luna는 정답률이 30% 미만이었습니다. 모델은 단계는 완벽하게 설명할 수 있었습니다("이미지를 회전시키고 픽셀을 세어야 합니다"). 하지만 실제로 수학을 수행할 수는 없었습니다. 이는 완벽한 레시피를 상세히 설명할 수는 있지만, 실제로 요리는 하지 못하는 요리사와 같았습니다.
그러나 연구진이 AI에게 파이썬 인터프리터를 주고 문제를 풀기 위한 코드를 작성하게 하자, 점수가 급등했습니다. GPT-5.6-luna의 정확도는 **43%**로 올라갔습니다. 오픈 소스 모델인 Qwen3.5-27B는 **12.6%**에서 **32.6%**로 상승했습니다. 코드를 통해 AI는 실제로 이미지 데이터를 처리할 수 있게 되었고, 이를 통해 추측 게임을 계산으로 바꿀 수 있었습니다.
비법: 스스로 디버깅하며 배우기
하지만 여기서 반전이 있습니다. 코드를 작성할 수 있게 되었음에도 불구하고, AI는 여전히 실수를 저질렀습니다. 겉보기에는 올바른 것처럼 보이지만, 픽셀 하나를 더 세거나 회전 값을 잘못 입력하는 등 눈에 보이지 않는 작은 오류가 있는 프로그램을 작성하곤 했습니다. AI는 코드를 실행하고 틀린 답을 얻은 뒤, 단순히 새로운 프로그램을 다시 작성하려 했고, 종종 같은 실수를 반복했습니다.
이를 해결하기 위해 저자들은 **'실행 가능한 추론에 대한 자기 성찰(Self-Reflection over Executable Reasoning)'**이라는 '자기 진화' 루프를 만들었습니다. 이것은 이 이야기에서 가장 흥잡한 부분입니다. AI가 시험을 치르는 학생이라고 상상해 보세요. 문제를 틀렸을 때, AI는 그냥 넘어가는 대신 다음 과정을 강제로 수행합니다:
- 실패한 시험 검토: 자신이 작성한 코드와 잘못 나온 답을 읽습니다.
- 시뮬레이션 실행: 코드가 정확히 어디서 깨졌는지 확인하기 위해 안전한 '샌드박스'에서 코드를 다시 실행합니다.
- 버그 수정: 실수를 바로잡기 위해 코드를 편집합니다.
- 교훈 저장: 수정된 코드가 제대로 작동하면, 이를 '기술(skill)'(텍스트 조각)로서 라이브러리에 저장합니다.
이 과정은 AI를 재학습시키거나 뇌 구조를 바꿀 필요 없이 이루어집니다. AI는 그저 자신의 실패로부터 배울 뿐입니다. 논문은 이 '자기 학습' 루프가 믿을 수 없을 정도로 강력하다는 것을 보여줍니다.
- GPT-5.6-luna 모델의 경우, 이러한 자기 진화된 기술을 사용함으로써 정확도가 **43%**에서 **67%**로 향상되었습니다.
- Qwen3.5-27B 모델의 경우, **32.6%**에서 **55.9%**로 뛰어올랐습니다.
왜 중요한가: 복사해서 붙여넣을 수 있는 기술들
가장 멋진 발견 중 하나는 이 '기술'들이 일반 텍스트라는 점입니다. 이 기술들은 AI의 뇌 속에 갇혀 있지 않습니다. 연구진은 거대하고 강력한 모델(예: 270억 파라미터 모델)이 학습한 기술을 훨씬 작고 약한 모델(90억 파라미터 모델)에 복사하여 붙여넣을 수 있다는 것을 보여주었습니다.
스스로는 문제를 풀 수 없었던 작은 모델은, 큰 모델이 작성한 '참조 가이드'를 읽는 것만으로 갑자기 훨씬 더 나아졌습니다.
- 9B 모델은 27B 모델이 진화시킨 기술을 사용함으로써 정확도가 **11.1%**에서 **34.5%**로 상승했습니다.
- 더욱 놀라운 점은, 이 기술들이 서로 다른 유형의 AI 모델들 사이에서도 작동했다는 것입니다. 한 모델 군에서 학습된 기술이 완전히 다른 모델 군의 성능을 개선하는 데 도움을 주었습니다.
이 논문이 부정하는 것
이 논문은 무엇이 효과가 없는지에 대해서도 명확히 밝히고 있습니다. 단순히 AI에게 도구 목록(예: "확대", "자르기", "검색")을 주는 것만으로는 이러한 특정 유형의 문제를 해결하기에 충분하지 않다고 주장합니다. AI는 처음부터 자신만의 알고리즘을 작성해야 합니다. 또한, 단순히 말로 더 많이 '생각'하는 것도 도움이 되지 않음을 보여줍니다. 병목 현상은 아이디어의 부족이 아니라, 실행력의 부족에서 발생합니다. AI는 알고리즘을 설명할 수는 있지만, 코드를 실행하지 않고서는 퍼즐을 풀 수 없습니다.
결론
이 논문은 시각적 계산이 필요한 문제에 있어서 AI가 생각하는 가장 좋은 방법은 코드를 작성하는 것이라고 제안합니다. 하지만 진짜 돌파구는 AI 모델이 자신의 실수를 디버깅함으로써 코드를 작성하는 능력을 스스로 향상시킬 수 있다는 점입니다. AI는 코드를 고쳐줄 인간 선생님을 필요로 하지 않습니다. 그저 코드를 실행할 샌드박스, 자신이 어디서 실패했는지 볼 수 있는 거울, 그리고 다시 시도할 약간의 인내심만 있으면 됩니다.
결과는 측정 가능하고 구체적입니다. 30가지 작업군에 대한 벤치마크에서, 자기 진화된 기술은 최상위 모델들의 성능을 40% 초반에서 60% 후반(정확도)까지 끌어올렸습니다. 이 논문이 모든 시각적 문제를 해결한다고 주장하는 것은 아니지만, 정답이 눈의 검사가 아닌 픽셀의 수학에 있는 작업들에 대해서는 코딩이 열쇠이며, 자기 성찰이 그 마스터 키임을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.