← 최신 논문
💻 computer science

Humans are Missing from AI Coding Agent Research

이 포지션 페이퍼는 AI 코딩 에이전트의 미래가 순수하게 자율적인 과제 해결에서 인간 중심의 협업으로 전환되어야 한다고 주장하며, 사용자 신뢰와 감독 측면의 현재 병목 현상을 극복하기 위해 정렬, 검증 가능성, 조종 가능성, 적응성과 같은 핵심적인 상호작용 차원을 다루어야 한다고 논한다.

원저자: Zora Z. Wang, John Yang, Kilian Lieret, Alexa Tartaglini, Valerie Chen, Yuxiang Wei, Zijian Wang, Lingming Zhang, Karthik Narasimhan, Ludwig Schmidt, Graham Neubig, Daniel Fried, Diyi Yang

게시일 2026-08-14
📖 6 분 읽기🧠 심층 분석

원저자: Zora Z. Wang, John Yang, Kilian Lieret, Alexa Tartaglini, Valerie Chen, Yuxiang Wei, Zijian Wang, Lingming Zhang, Karthik Narasimhan, Ludwig Schmidt, Graham Neubig, Daniel Fried, Diyi Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 코더 퍼즐의 잃어버린 조각

컴퓨터가 단순히 명령을 따르는 것을 넘어 실제로 우리를 위해 무언가를 수행하는 세상을 상상해 보십시오. 이것이 바로 인공지능(AI), 특히 AI 에이전트라고 불리는 분야의 흥hi로운 영역입니다. 에이전트를 단순히 대화만 하는 챗봇이 아니라, 컴퓨터 프로그램을 열고, 엉망인 파일을 읽고, 실수를 수정하고, 스스로 작업을 저장할 수 있는 디지털 노동자로 생각하십시오. 소프트웨어 세계에서 이러한 에이전트들은 코드를 작성하도록 교육받고 있습니다. 즉, 컴퓨터가 어떻게 행동해야 하는지를 알려주는 지침을 말이죠. 오랫동안 과학자들의 큰 목표는 단순했습니다. 이 에이전트들을 매우 똑똑하고 독립적으로 만들어 인간의 도움 없이도 복잡한 문제를 해결할 수 있게 만드는 것이었습니다. 그것은 마치 로봇에게 벽돌을 쌓는 것부터 벽을 칠하는 것까지, 단 한 명의 인간 감독자 없이 집을 완전히 스스로 짓도록 훈련시키는 것과 같았습니다.

하지만 여기 함정이 있습니다. 로봇이 혼자서 집을 지을 수 있다고 해서, 그것이 반드시 '올바른' 집을 짓고 있다거나 인간 집주인이 그 결과에 만족한다는 뜻은 아닙니다. 여러분이 읽게 될 이 논문은 이 분야에서 커지고 있는 문제를 다룹니다. 이 논문은 우리가 AI 에이전트를 더 "자율적(혼자서 일할 수 있는 능력)"으로 만드는 데 집착하는 동안, 방정식에서 가장 중요한 부분인 '인간'을 잊어버렸다고 주장합니다. 저자들은 AI 코딩의 미래가 인간을 솔로 로봇으로 대체하는 것이 아니라, 우리의 말을 듣고, 자신의 작업을 설명하며, 우리가 요청할 때 생각을 바꿀 수 있는 파트너를 만드는 것이라고 주장합니다. 이는 당신이 차고를 요청했는데도 고집스럽게 창고를 짓는 로봇과, "저기, 차고를 원하신 게 맞나요? 그리고 빨간 벽돌을 쓸까요, 파란 벽돌을 쓸까요?"라고 묻는 로봇의 차이와 같습니다.


논문: 왜 "솔로" 로봇은 본질을 놓치고 있는가

**"Humans are Missing from AI Coding Agent Research(AI 코딩 에이전트 연구에서 인간이 누락되었다)"**라는 제목의 이 논문은 카네기 멜론, 스탠퍼드, 프린스턴과 같은 유수의 대학 연구진들이 던지는 경종입니다. 그들은 현재의 AI 코딩 에이전트를 살펴보고, 성공을 측정하는 방식에 심각한 결함이 있음을 지적하고 있습니다.

문제점: "솔로"에 대한 집착
현재 AI 세계는 로봇이 혼자서 얼마나 빨리 레벨을 완료하느냐만이 유일한 점수인 비디오 게임과 같습니다. 연구자들은 끊임없이 인간의 도움 없이 더 어려운 코딩 퍼즐을 풀 수 있는 에이전트를 만들기 위해 노력하고 있습니다. 논문은 이것이 함정이라고 주장합니다. 이러한 에이전트들이 (실행 오류 없이 돌아가는) 코드를 작성하는 능력은 좋아지고 있지만, 사람과 함께 일하는 능력은 오히려 나빠지고 있기 때문입니다.

저자들은 이를 보여주기 위해 생생한 예를 사용합니다: 패치 블로트(Patch Bloat, 패치 비대화). 만약 당신이 친구에게 이야기 속의 오타 하나를 고쳐달라고 부탁했다고 상상해 보십시오. 도움이 되는 친구라면 딱 그 단어 하나만 바꿀 것입니다. 하지만 도움이 되지 않고 지나치게 의욕만 앞선 로봇은 문단 전체를 다시 쓰고, 새로운 챕터 세 개를 추가하고, 글꼴까지 바꿔버릴 수도 있습니다. 당신은 단지 오타 하나만 고치길 원했을 뿐인데 말이죠. 논문은 AI 에이전트들이 지속적으로 이런 행동을 하고 있음을 발견했습니다. 그들은 필요 이상으로 훨씬 길고 복잡한 코드 변경 사항을 만들어냅니다. 이는 인간이 코드가 정말로 정확한지 확인하는 것을 매우 어렵게 만듭니다. 마치 천 개의 여분의 조각 더미 속에서 단 하나의 빠진 퍼즐 조각을 찾는 것과 같습니다.

핵심 주장: 우리는 교체가 아닌 팀이 필요하다
논문은 AI의 다음 큰 돌파구가 에이전트를 혼자서 더 빠르게 만드는 것이 아니라, 인간과 더 잘 협력하게 만드는 데서 올 것이라고 제안합니다. 저자들은 우리가 "완벽한 솔로 연주자"를 만드는 것을 멈추고 "훌륭한 팀 플레이어"를 만들기 시작해야 한다고 제안합니다.

이를 위해 그들은 좋은 AI 코딩 파트너가 갖춰야 할 네 가지 핵심 기술을 도입하며, 이를 **"인간-에이전트 협업 루프(Human-Agent Collaboration Loop)"**라고 부릅 목적입니다:

  1. 작업 정렬 (Task Alignment - "그 뜻인가요?" 기술):
    이는 당신이 말한 그대로가 아니라, 당신이 실제로 무엇을 원하는지를 이해하는 것에 관한 것입니다. 만약 당신이 에이전트에게 "웹사이트를 만들어줘"라고 말한다면, 솔로 로봇은 그냥 빈 페이지를 만들 수도 있습니다. 하지만 좋은 팀플레이어는 "다크 모드를 원하시나요, 라이트 모드를 원하시나요? 연락처 양식이 있어야 하나요?"라고 물어봅니다. 논문은 에이전트가 코드를 치기 전에 숨겨진 세부 사항을 파악하고 명확한 질문을 던지는 능력이 더 좋아져야 한다고 주장합니다.

  2. 조종 가능성 (Steerability - "운전대를 잡으세요" 기술):
    자율 주행 기능이 작동하여 끝날 때까지 당신이 핸들을 만질 수 없게 만드는 자동차를 운전한다고 상상해 보십시오. 그것은 매우 답답한 일입니다. 조종 가능성이란 에이전트가 결정적인 순간에 당신이 개입할 수 있도록 허용해야 함을 의미합니다. 만약 에이전트가 웹사이트를 만들고 있는데 당신이 "잠깐만요, 저 파란색이 마음에 안 들어요, 초록색으로 바꿔주세요"라고 말한다면, 조종 가능한 에이전트는 즉시 멈추고 그것을 바꿉니다. 조종 불가능한 에이전트는 당신을 무시하고 사이트 전체를 파란색으로 완성한 뒤, "완료했습니다!"라고 말할 것입니다. 논문은 에이전트가 결정 지점에서 멈추고 인간이 길을 안내할 수 있도록 해야 한다고 제안합니다.

  3. 검증 가능성 (Verifiability - "풀이 과정을 보여주세요" 기술):
    이는 신뢰에 관한 것입니다. 만약 에이전트가 완성된 프로젝트를 건네준다면, 당신은 그것이 맞다는 것을 어떻게 알 수 있을까요? 현재 에이전트들은 종종 읽기 어려운 거대하고 혼란스러운 코드 덩어리를 넘겨줍니다. 논문은 에이전트가 인간이 확인하기 쉬운 방식으로 작업물을 제시해야 한다고 주장합니다. 단순히 코드를 쏟아내는 대신, 시각적 미리보기를 보여주거나, 간단한 요약을 제공하거나, 그런 변경을 했는지 설명해야 합니다. 만약 당신이 이해할 수 없다면, 당신은 그것을 신뢰할 수 없습니다.

  4. 적응성 (Adaptability - "나를 기억하세요" 기술):
    인간은 경험으로부터 배웁니다. 만약 당신이 인간 비서에게 "나는 다크 모드를 선호해요"라고 말한다면, 그들은 다음을 위해 그것을 기억할 것입니다. 논문은 대부분의 AI 에이전트가 기억력이 형편없다는 점을 지적합니다. 새로운 작업을 시작할 때마다 당신은 그들에게 당신의 선호도, 코딩 스타일, 프로젝트 규칙을 다시 알려줘야 합니다. 이를 "프롬프트 피로(prompt fatigue)"라고 합니다. 저자들은 과거의 상호작용으로부터 배우고, 당신이 무엇을 좋아하는지 기억하며, 시간이 지남에 따라 당신과 더 잘 협업할 수 있는 에이전트를 원합니다.

이 논문이 제외하는 것
저자들은 자신들이 무엇을 말하려는 것이 아닌지 매우 명확히 밝히고 있습니다. 그들은 AI 에이전트가 쓸모없다거나 코드를 작성할 수 없다고 주장하는 것이 아닙니다. 사실 그들은 코드가 점점 좋아지고 있다는 점을 인정합니다. 또한 인간이 모든 코딩을 직접 해야 한다고 말하는 것도 아닙니다.

대신, 그들은 AI의 목표가 인간 개발자를 완전히 대체하는 시스템을 만드는 것이라는 생각에 명시적으로 반대합니다. 그들은 "완전한 자율성"에 대한 현재의 집착이 오히려 우리를 저해하고 있다고 제안합니다. 그들은 에이전트가 혼자서 완벽하게 작동하도록 만드는 것이 막다른 길이라고 믿는데, 왜냐하면 실제 코딩은 지저치고, 목표가 변하며, 인간의 판단을 필요로 하기 때문입니다. 또한 그들은 인간과의 상호작용이 단순히 "멍청한" AI를 위한 임시방편이라는 생각에도 반박합니다. 그들은 인간 중심의 설계가 임시 처방이 아니라 미래라고 주장합니다.

얼마나 확신하는가?
저자들은 자신들이 본 데이터에 근거하여 관찰한 내용에 확신을 가지고 있습니다. 그들은 개발자들이 통제하기 어렵거나 검증하기 힘든 AI 도구들에 대해 느끼는 좌절감을 보여주는 실제 세계의 트렌드를 지적합니다. 그들은 시뮬레이션과 기존 코딩 벤치마크(SWE-bench 등)의 분석을 통해, 에이전트가 더 많은 과제를 해결하고 있음에도 불구하고 상호작용의 질은 떨어지고 있음을 보여줍니다.

예를 들어, 에이전트가 코딩 문제를 성공적으로 해결하더라도, 그들이 생성한 코드가 종종 "비대(bloated)"하며(너무 길며), 자동화된 테스트를 통과하더라도 인간이 작성했을 법한 것과는 기능적으로 다르다는 데이터를 제시합니다. 이는 AI를 테스트하는 현재 방식(단순히 테스트를 통과하는지만 확인하는 방식)이 코드가 실제로 유용한지 혹은 이해 가능한지에 대한 더 큰 그림을 놓치고 있음을 시사합니다.

그들은 아직 이 문제들을 해결했다고 주장하는 것이 아닙니다. 대신, 미래를 위한 새로운 로드맵을 제안하고 있습니다. 그들은 연구자들이 인간 사용자를 시뮬레이션할 수 있는 새로운 도구를 구축하고, 단순히 단위 테스트(unit tests)를 넘어 코드를 검증할 수 있는 더 나은 방법을 만들며, 에이전트가 얼마나 빠르게 과제를 끝내느냐가 아니라 인간과 얼마나 잘 협업하는지를 측정하는 시스템을 설계해야 한다고 제안합니다.

대단원
요약하자면, 이 논문은 AI 커뮤니티를 향한 호소입니다: 혼자 일하는 로봇을 만드는 것을 멈추고, 우리와 함께 일하는 파트너를 만들기 시작하십시오. 코딩의 미래는 로봇이 당신의 직업을 빼앗는 것이 아니라, 당신이 일을 더 잘, 더 빠르게, 스트레스 없이 할 수 있도록 돕는 로봇에 관한 것입니다. 그것은 목표를 "AI가 할 수 있는가?"에서 "AI와 인간이 함께 할 수 있는가?"로 전환하는 것입니다.

저자들은 만약 우리가 인간적인 요소를 무시한다면, 사람들이 실제로 사용하기에는 너무 혼란스럽고, 너무 경직되어 있으며, 신뢰할 수 없는 강력한 도구들을 갖게 될 것이라고 믿습니다. 정렬(alignment), 조종 가능성(steerability), 검증 가능성(verifiability), 그리고 적응성(adaptability)에 집중함으로써, 우리는 단순히 코드를 쓰는 것이 아니라, 그것을 필요로 하는 사람들과 진정으로 협업할 수 있는 AI를 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →