← 최신 논문
💬 NLP

The Best Programming Language for Tokenmaxxing: An Investigation of Coding Agent Behavior Across Programming Languages

이 논문은 코딩 에이전트가 서로 다른 프로그래밍 언어에 걸쳐 토큰 소비량에서 어떻게 상당하고 일관된 변동을 보이는지 조사하며, 이러한 비효율성이 익숙하지 않은 언어에서 컴파일되지 않는 코드를 생성하거나, 제공된 테스트를 불신하거나, 파이썬으로 프로토타이핑하는 등의 행동에서 기인한다는 점을 밝힘으로써, 언어별 토큰 효율성을 벤치마킹 및 비용 최적화를 위한 핵심 지표로 확립한다.

원저자: Zixuan Wu, Carolyn Jane Anderson, Arjun Guha

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zixuan Wu, Carolyn Jane Anderson, Arjun Guha

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 당신을 위해 컴퓨터 프로그램을 작성해 줄 수 있는 아주 똑똑하고 지칠 줄 모르는 로봇 비서를 고용했다고 상상해 보세요. 당신이 퍼즐을 하나 주면, 로봇은 코드를 타이핑하고, 테스트를 실행하고, 실수를 수정하며, 정답을 맞힐 때까지 다시 시도합니다. 이것이 바로 '코딩 에이전트(coding agents)'의 세계입니다. 이들은 단순히 질문에 답하는 것을 넘어 실제로 소프트웨어를 구축하는 새로운 종류의 인공지능입니다. 하지만 여기 함정이 있습니다. 이 로봇들은 공짜로 일하지 않습니다. 로봇이 생각하거나, 단어 하나를 타이핑하거나, 자신의 작업을 확인할 때마다 '토큰(tokens)'을 소비합니다. 토큰을 자동차의 연료나 휴대폰 요금제의 시간처럼 생각하세요. 로봇이 더 많이 생각하고 더 많이 다시 작성할수록, 더 많은 연료를 태우게 됩니다.

이제 당신이 이 로봇에게 똑같은 퍼즐을 풀라고 요청하되, 이번에는 다른 언어로 솔루션을 작성하라고 말한다고 상상해 보세요. 예를 들어 로봇이 영어와 매우 유사한 파이썬(Python)으로 작성할 수도 있고, 혹은 비밀 수학 코드처럼 보이는 OCaml로 작성할 수도 있습니다. 당신은 퍼즐이 동일하다면 로봇이 언어와 상관없이 똑같은 양의 연료를 태울 것이라고 가정할지도 모릅니다. 하지만 만약 그 언어 자체가 로봇의 발을 헛디디게 만든다면 어떨까요? 어떤 언어는 로봇에게 매끄러운 고속도로 같지만, 어떤 언어는 로봇이 길을 잃고 뱅뱅 돌며 어떻게 걸어야 할지 알아내기 위해 추가적인 연료를 태우며 허우적거리는 진흙탕 늪 같을 수도 있습니다. 이것이 바로 연구진이 해결하고자 했던 질문입니다: 당신이 선택한 프로그래밍 언어가 AI 비서가 업무를 완수하기 위해 태우는 '연료'(토큰)의 양을 변화시킬까요?

연구자들인 Zixuan Wu, Carolyn Jane Anderson, Arjun Guha는 100개의 방대한 프로그래밍 퍼즐 세트에 코딩 에이전트를 풀어놓음으로써 이를 조사하기로 했습니다. 그들은 단순히 로봇이 정답을 맞혔는지만을 본 것이 아니라, 마치 보안 카메라 영상을 검토하는 탐정처럼 로봇이 취한 모든 단계 하나하나를 관찰했습니다. 그들은 다섯 가지 서로 다른 AI 모델을 네 가지 다른 언어(Python, Java, Rust, Ocaml)로 테스트했습니다.

그들의 가장 큰 발견은 언어가 엄청나게 중요하다는 것이었습니다. 퍼즐의 난이도가 정확히 같더라도, 로봇은 Python에 비해 OCaml과 Rust로 작업할 때 훨씬 더 많은 토큰을 소모했습니다. 실제로 어떤 모델의 경우, OCaml으로 작성하는 것이 Python보다 거의 1.7배 더 많은 토큰 비용이 들었습니다. 저자들은 이것이 최종 코드가 더 길어졌기 때문이 아니라, 로봇이 혼란을 겪고 더 많은 실수를 저질렀으며, 이를 수정하기 위해 더 열심히 노력해야 했기 때문이라고 설명합니다.

하지만 정말 흥란 부분은 로봇이 어떻게 막혔는지를 관찰하는 것이었습니다. 연구진은 로봇이 OCaml 같은 까다로운 언어에서 벽에 부딪혔을 때, 단순히 포기하는 것이 아니라는 점을 발견했습니다. 대신, 그들은 이상하게 행동하기 시작했습니다. 때때로 그들은 모든 테스트를 통과하는 솔루션을 얻었음에도 불구하고, 마치 자신의 성공을 믿지 못하는 것처럼 불필요한 주석을 달거나 스타일을 바꾸며 계속해서 다시 작성하곤 했습니다. 또 다른 경우에는, 단순한 구문 오류(예: 세미콜론 누락)에 걸려 무엇이 잘못되었는지 깨닫지 못한 채 똑같은 고장 난 코드를 반복해서 다시 쓰며 뱅뱅 돌기도 했습니다.

아마도 가장 재미있는 행동은, 로봇이 잘 모르는 언어를 접했을 때 약간의 '꼼수'를 쓴다는 점이었을 것입니다. 그들은 자신이 편안하고 자신감 있게 느끼는 Python으로 먼저 문제를 몰래 해결한 다음, 그 Python 솔루션을 OCaml이나 Rust 같은 대상 언어로 번역하려고 시도했습니다. 이는 머릿속으로는 수학 문제를 풀 줄 알지만, 문법이 서툴러서 그 문제를 겨우 익힌 언어로 적으려다 보니 수학은 알면서도 문법 때문에 혼란을 겪는 학생과 같습니다.

연구는 또한 저자들이 농담조로 '최대 토큰 소비(tokenmaxxing)'라고 부른 개념도 살펴보았습니다. 그들은 AI가 가능한 한 많은 돈을 쓰게 만들고 싶다면 OCaml을 선택해야 한다고 말합니다. 그러면 로봇은 문제를 해결하기 위해 고군분투하고, 다시 작업하고, 과하게 생각하며 엄청난 양의 토큰을 소비할 것입니다. 반대로, AI가 효율적이고 저렴하게 작동하기를 원한다면 Python이 확실한 승자입니다.

결론적으로, 이 논문은 프로그래밍 언어의 선택이 단순히 코드가 어떻게 보이는지의 문제가 아니라, AI가 생각하는 방식 자체를 바꾼다는 점을 시사합니다. 어떤 언어는 부드러운 안내자 역할을 하지만, 어떤 언어는 로봇을 뱅뱅 돌게 만드는 미로 역할을 합니다. 저자들은 이러한 행동을 이해함으로써, 어떤 언어로 말을 하라고 요청받더라도 연료를 낭비하지 않는 더 나은, 더 효율적인 로봇을 만들 수 있기를 바랍니다. 또한 그들은 자신들의 특정 실험에서 이러한 패턴을 발견했지만, 미래의 로봇들은 더 똑똑해져서 이러한 까다로운 언어들을 더 잘 다룰 수도 있으므로, 이 결과는 우주의 영원한 법칙이 아니라 현재 상황을 보여주는 스냅샷이라는 점을 경고합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →