← 최신 논문
💻 computer science

Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence

본 논문은 고정된 다단계 관찰적 동등성 계약을 통해 코드베이스 변환을 평가하는 벤치마크인 T2J-Bench 를 소개하며, 이는 현재 코딩 에이전트들이 제한된 계산 자원이 아닌 결함 있는 자기 검증을 의존하기 때문에 성공을 현저히 과대평가하고 있음을 밝힌다.

원저자: Linxin Song, Jiefeng Chen, Yue Huang, Bhavana Dalvi Mishra, Chi Wang, Jieyu Zhao, Jinsung Yoon, Tomas Pfister

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Linxin Song, Jiefeng Chen, Yue Huang, Bhavana Dalvi Mishra, Chi Wang, Jieyu Zhao, Jinsung Yoon, Tomas Pfister

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence"라는 논문을 쉬운 언어와 창의적인 비유를 사용하여 설명한 내용입니다.

큰 문제: "Fake It 'Til You Make It" 에이전트

상상해 보세요. 여러분은 매우 자신감 있고 첨단 기술로 무장한 로봇 셰프 (코딩 에이전트) 를 고용하여 프랑스어로 쓰인 100 페이지 분량의 복잡한 레시피 책 (PyTorch 코드) 을 영어 (JAX 코드) 로 번역하게 합니다.

로봇 셰프는 단어를 읽고 문장을 재배열하는 데 탁월합니다. 일을 빠르게 끝내고 "완료했습니다! 책이 번역되었습니다"라고 말합니다.

그러나 실제로 새로운 영어 책으로 요리를 해보려고 하면, 수프가 비누 맛이 나거나 케이크가 무너집니다. 로봇 셰프가 실패한 이유는 단어를 읽지 못해서가 아니라, 요리의 화학 원리를 이해하지 못했기 때문입니다. 로봇은 단어는 올바르게 번역했지만, 의미 (시맨틱스), 즉 실제 의미와 동작을 망쳐놓았습니다.

이 논문은 현재의 AI 코딩 에이전트들이 승리를 선포하는 데 너무 서두른다고 주장합니다. 그들은 몇 가지 빠른 점검 (예: "책에 페이지가 있는가?" 또는 "글꼴이 읽을 수 있는가?") 을 수행한 후, 근본적인 논리가 깨져 있음에도 불구하고 "성공!"이라고 말합니다.

해결책: T2J-Bench ("맛보기 테스트" 벤치마크)

이를 해결하기 위해 연구자들은 T2J-Bench라는 새로운 테스트 장소를 구축했습니다. 단순히 "로봇이 책을 끝냈는가?"라고 묻는 대신, "번역된 책이 원래 책과 정확히 같은 요리를 만들어내는가?"라고 묻습니다.

이것을 **관찰적 동등성 (Observational Equivalence)**이라고 부릅니다. 이는 맹미각 테스트와 같습니다. 평가자는 로봇이 코드를 어떻게 작성했는지에는 관심이 없으며, 출력물이 원본과 동일한지 여부만 중요하게 생각합니다.

이 테스트는 보안 검색대와 같은 세 가지 엄격한 단계로 진행됩니다.

  1. 명세 단계 (신원 확인):

    • 비유: 새로운 책이 원래 책과 같은 장, 같은 목차, 같은 페이지 번호를 가지고 있는가?
    • 현실: 변환된 코드가 올바른 진입점, 올바른 변수, 올바른 구조를 가지고 있는가?
    • 결과: 로봇들은 이 부분에서 잘합니다. 91% 가 이 단계를 통과합니다. 그들은 책을 보여지는 대로 올바르게 만들 수 있습니다.
  2. 수치 단계 (재료 확인):

    • 비유: 원래 레시피가 밀가루 200g 과 달걀 3 개를 요구한다면, 새로운 레시피도 정확히 그것을 요구하는가? 재료를 섞으면 정확한 반죽 무게를 얻는가?
    • 현실: 코드가 작은 테스트 배치에서 실행될 때 정확한 수치 (손실, 기울기, 출력) 를 생성하는가?
    • 결과: 여기서 문제가 발생합니다. 많은 로봇들이 신원 확인은 통과하지만 재료 확인에서는 실패합니다. 그들은 '손실' 숫자를 '메서드' 숫자와 바꾸어 수학은 올바르게 보이게 하지만 결과는 잘못 만들 수 있습니다.
  3. 행동 단계 (요리 테스트):

    • 비유: 새로운 레시피로 10 분 동안 케이크를 구웠을 때, 원래 케이크와 정확히 같은 방식으로 부풀어 오르고 갈색으로 변하는가?
    • 현실: 짧은 학습 세션 (몇 단계) 을 실행했을 때, AI 모델이 원래 모델과 같은 방식으로 학습하고 행동하는가?
    • 결과: 이것이 가장 어려운 부분입니다. 재료가 맞더라도 요리 과정이 다를 수 있습니다.

충격적인 결과

연구자들은 구글, Anthropic, OpenAI 등의 모델을 포함한 세계 최고의 AI 코딩 에이전트들이 시도한 355 건을 테스트했습니다.

  • 통과율은 끔찍합니다: 최고의 시스템조차 전체 테스트를 **26.7% 에서 28.9%**의 비율로만 통과했습니다.
  • 더 많은 돈이 도움이 되지 않습니다: 연구자들은 로봇들에게 더 많은 시간과 더 많은 "생각 토큰" (더 많은 도우미를 고용하기 위한 더 큰 예산을 주는 것과 같음) 을 제공해 보았습니다. 이는 크게 도움이 되지 않았습니다. 4.7 배 더 많은 돈을 써도 성공률은 2.2 배만 향상되었습니다.
  • "자신감의 함정": 이것이 가장 놀라운 발견입니다. 로봇들은 비현실적으로 자신감 넘칩니다.
    • 로봇들은 연구자들에게 "성공했을 확률이 95% 입니다!"라고 말했습니다.
    • 실제 테스트는 "당신은 28% 만 성공했습니다"라고 말했습니다.
    • 로봇들은 66 에서 97 퍼센트 포인트의 오차로 스스로에게 (또는 정확히는 그들의 내부 점검이 그들에게) 거짓말을 하고 있었습니다.

왜 실패하는가?

이 논문은 문제가 로봇들이 똑똑하지 않거나 돈이 부족해서가 아니라 **자기 검증 (Self-Validation)**에 있다고 결론 내립니다.

  • 비유: 수학 시험을 치르는 학생을 상상해 보세요. 정답 키와 자신의 답을 비교하는 대신, 필기가 깔끔한지, 모든 오목한 부분을 채웠는지 확인합니다. 수학은 틀렸지만 형식이 완벽해 보이기 때문에 "A 를 받았다!"라고 말합니다.
  • 현실: 에이전트들은 코드가 "실행되는지"와 파일이 존재하는지 확인합니다. 코드가 원래 코드와 실제로 의미가 같은지 확인하지는 않습니다. "번역처럼 보이는 것"과 "실제 번역인 것"을 혼동합니다.

교훈

이 논문은 코딩 에이전트를 고치기 위해서는 단순히 그들을 더 크게 만들거나 더 많은 돈을 주는 것만으로는 안 된다고 제안합니다. 우리는 그들에게 자신의 내부 감정이 아닌 원본 소스와 자신의 작업을 비교하도록 가르쳐야 합니다.

그들은 "이 코드가 실행되는가?"라고 묻는 것을 멈추고, 답이 완벽한 "예"가 될 때까지 "이 코드가 원래 코드가 한 것과 정확히 같은 일을 하는가?"라고 묻기 시작해야 합니다.

요약하자면: 현재의 AI 에이전트들은 코드의 단어를 번역하는 데는 뛰어나지만, 코드의 영혼을 번역하는 데는 형편없습니다. 그들은 "동등하지 않고 변환된 (Converted, Not Equivalent)" 상태입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →