← 최신 논문
🤖 AI

Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging

이 논문은 LLM 코딩 에이전트를 평가하기 위해 설계된 6개의 과학 분야에 걸친 57개의 전문가 검증 계산 이미징 태스크 벤치마크인 Imaging-101을 소개하며, 현재의 프런티어 모델들이 알고리즘 선택 및 물리적 관례 처리와 같은 도메인 특화된 과제에서 어려움을 겪고 있음을 밝힘으로써 신뢰할 수 있는 과학적 발견을 가능하게 할 전문화되고 기술이 증강된 에이전트의 필요성을 강조한다.

원저자: Siyi Chen, Jiahe Ying, Yixuan Jia, Yuxuan Gu, Enze Ye, Weimin Bai, Zhijun Zeng, Shaochi Ren, Binhong Gao, Yubing Li, Tianhan Zhang, He Sun

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Siyi Chen, Jiahe Ying, Yixuan Jia, Yuxuan Gu, Enze Ye, Weimin Bai, Zhijun Zeng, Shaochi Ren, Binhong Gao, Yubing Li, Tianhan Zhang, He Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 흐릿하고 노이즈가 가득한 비밀스러운 물체의 사진을 수정처럼 맑은 사진으로 바꿔주는 마법의 상자가 있다고 상상해 보세요. 실제 과학의 세계에서 이것은 마법이 아니라 **컴퓨터 이미징(computational imaging)**이라고 불립니다. 과학자들은 이를 통해 블랙홀의 내부, 바이러스의 구조, 혹은 땅속 깊은 곳에서 무슨 일이 일어나고 있는지와 같이 직접 만질 수 없는 것들을 관찰합니다. 하지만 그 흐릿한 덩어리를 선명한 사진으로 바꾸는 "레시피"를 만드는 것은 매우 어려운 일입니다. 여기에는 물리학, 수학, 코딩에 대한 박사급 이해는 물론, 전체 이미지를 망칠 수 있는 아주 작은 실수들을 바로잡기 위한 엄청난 인내심이 필요합니다.

여기, 인공지능을 위한 새로운 "운전 면허 시험"인 Imaging-101이 등장했습니다. 연구진은 천문학, 생물학, 화학, 지구과학, 의학, 물리학 등 6개 분야에서 가져온 57개의 서로 다른 퍼즐(태스크)로 도전 과제를 만들었습니다. 그들은 단순히 AI에게 코드를 작성하라고 요구한 것이 아니라, 이 퍼즐들을 처음부터 끝까지 해결할 수 있는 완전하고 작동하는 기계를 구축하라고 요구했습니다.

3단계 테스트

연구진은 AI가 정말 똑똑한 것인지 아니면 그저 운이 좋았던 것인지 확인하기 위해 세 가지 방식으로 테스트를 진행했습니다.

  1. 계획(The Plan): 먼저, AI는 청사진을 작성해야 했습니다. 단 한 줄의 코드를 쓰기 전에 올바른 수학적 원리와 단계들을 파악할 수 있을까요?
  2. 레고 블록(The Lego Blocks): 다음으로, AI는 기계의 특정 부품들(예: "전처리" 또는 "솔버" 블록)을 구축하고, 각 부품에 대해 엄격하고 세밀한 단위 테스트를 통과해야 했습니다.
  3. 완전한 주행(The Full Drive): 마지막으로, AI는 전체 기계를 조립하고 실행하여, 엄격한 품질 검사를 통과할 만큼 정확한 사진을 만들어내야 했습니다.

결과: AI는 말하기에는 능숙하지만, 물리학에는 서툴다

연구진은 사용 가능한 가장 똑똑한 7개의 AI 모델을 테스트했습니다. 결과는 다음과 같았습니다.

  • "계획"은 괜찮았습니다: AI는 청안을 작성하는 데 놀라울 정도로 능숙했습니다. 상위 모델들(GPT-5.4 및 Kimi-k2.5)은 약 **52.6%**의 확률로 전반적인 개념을 제대로 파악했습니다. 그들은 사용할 올바른 수학 유형을 명시할 수 있었습니다.
  • "레고 블록"은 흔들렸습니다: 실제로 부품을 구축할 때가 되자 상황이 엉망이 되었습니다. 모든 부품을 한꺼번에 올바르게 구축하는 데 성공한 비율은 1.8%에서 22.8% 사이로 떨어졌습니다.
  • "완전한 주행"이 가장 어려웠습니다: 가장 뛰어난 AI인 Claude-4.6-Opus조차도 실제로 작동하여 좋은 사진을 만들어내는 기계를 구축하는 데는 **29.8%**의 성공률을 보였습니다. 다른 모델들은 이보다 훨씬 못 미쳤으며, 일부는 성공률이 **7%**에 불과했습니다.

"보이지 않는" 함정들

이 연구에서 가장 흥리학적인 부분은 AI가 왜 실패했는가 하는 점입니다. 그들은 코드를 쓸 줄 몰라서 실패한 것이 아니라, 과학자들이 수년간의 경험을 통해 배우는 "비밀 규칙"들을 놓쳤기 때문에 실패했습니다.

논문에서는 이를 **"수치적 관습 드리프트(numerical-convention drift)"**라고 부릅니다. 케이크를 굽는다고 상상해 보세요. AI는 레시피에 "밀가루를 넣으시오"라고 적혀 있다는 것은 알지만, 이 특정 주방에서는 밀가루를 컵이 아닌 그램(g) 단위로 측정해야 하며, 먼저 체에 걸러야 한다는 사실은 잊어버립니다. AI의 케이크는 모양도 케이크 같고 냄새도 케이크 같지만, 크기와 질감이 잘못된 것입니다.

연구에서 AI들은 다음과 같은 구체적인 실수를 저질렀습니다:

  • 잘못된 단위: 빛의 산란과 관련된 작업에서, AI는 "강도(intensity, 빛의 밝기)"를 "진폭(amplitude, 파동의 세기)"으로 변var환하는 것을 잊었습니다. 이는 마치 자동차의 속도를 "마일 퍼 아워" 대신 "밝기"로 측정하려는 것과 같았습니다.
  • 잘못된 솔버(Solvers): AI는 특수한 도구(예: 레이저 메스)가 필요한 작업에 일반적인 수학 도구(예: 표준 망치)를 선택했습니다. 논문에서 특정하고 복잡한 방법을 요구했음에도 불구하고, AI는 "이 일반적인 방법을 사용하겠습니다"라고 말하며 흔한 방식을 택했습니다.
  • 정규화 누락: MRI 스캔에서 AI는 신체의 일부가 센서에 더 가까이 있다는 사실을 고려하여 조정하는 것을 잊었습니다. 이로 인해 코드는 오류 없이 실행되었음에도 불구하고 최종 이미지는 이상한 그림자가 진 것처럼 보였습니다.

"블랙박스"의 놀라움

연구진은 실제 컴퓨터 터미널에 접속하여 소프트웨어를 설치하고 파일을 볼 수 있는 권한을 가진 "블랙박스" 에이전트(Claude Code)를 테스트했습니다. 이 에이전트는 **56.1%**의 성공률을 기록하며 훨씬 더 나은 성과를 보였습니다. 이는 AI에게 더 많은 탐색과 스스로의 실수를 수정할 수 있는 자유를 주는 것이 도움이 된다는 것을 시사하지만, 그럼에도 불구하고 여전히 완벽하지는 않다는 것을 보여줍니다.

이것이 의미하는 바

이 논문은 AI가 코드를 작성하는 능력은 향상되고 있지만, 과학적 이미징의 **깊고 암묵적인 지식(tacit knowledge)**에는 여전히 어려움을 겪고 있다는 점을 분명히 합니다. 이는 야구 규칙은 달달 외우고 있지만, 실제로 커브볼을 잡는 법은 모르는 학생과 같습니다.

연구진은 AI가 물리적으로 올려 정답인 것보다는, 학습 데이터에서 "통계적으로 흔한" 것에 의존하여 실패하는 경우가 많다는 것을 발견했습니다. 이를 해결하기 위해서는 AI가 모든 물리 법칙을 처음부터 스스로 깨우치기를 기대하기보다, 사전에 검증된 도메인 특화 기술들이 담긴 "도구 상자"를 갖춘 AI 어시스턴트를 구축해야 할 수도 있다고 제안합니다.

요약하자면, AI는 퍼즐을 푸는 이야기를 써 내려갈 수는 있지만, 수학을 검토하고 물리학이 실제로 맞는지 확인하기 위해서는 여전히 인간 전문가가 필요합니다. 완전히 자동화된 과학적 발견 기계를 향한 꿈은 여전히 진행 중인 과제입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →