← 최신 논문
🤖 AI

Context-Augmented Code Generation: How Product Context Improves AI Coding Agent Decision Compliance by 49%

본 논문은 코드베이스만 접근하는 경우보다 팀별 제품 결정에 대한 준수를 49% 포인트 향상시켜 현실적인 소프트웨어 엔지니어링 작업에서 95%의 준수율을 달성하는 제품 컨텍스트 검색 시스템 (Brief) 을 갖춘 AI 코딩 에이전트의 개선 효과를 입증하는 통제된 벤치마크를 소개합니다.

원저자: Drew Dillon, Kasyap Varanasi

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Drew Dillon, Kasyap Varanasi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신 회사의 웹사이트에 새로운 기능을 구축하기 위해 천재적이고 매우 빠른 견습 프로그래머를 고용한다고 상상해 보세요. 이 견습생 (AI) 은 당신이 작성한 모든 코드 라인을 읽을 수 있고, 컴퓨터가 어떻게 작동하는지 이해하며, 실제로 충돌 없이 실행되는 새로운 코드를 작성할 수 있습니다.

하지만 여기에 문제가 있습니다: 이 견습생은 회사의 암묵적인 규칙을 알지 못합니다.

실제 사무실에서는 팀마다 코딩을 위한 '비밀 인사'가 존재합니다. 예를 들어, "더 이상 그 특정 캘린더 위젯을 절대 사용하지 않는다"거나 "데이터를 내보낼 때마다 보안 감사를 위해 반드시 로그를 남겨야 한다"거나 "테스트를 항상 테스트하는 코드 바로 옆에 배치한다"는 규칙이 있을 수 있습니다. 이러한 규칙들은 코드 자체에 명시되어 있지 않습니다. 대신 회의록, 설계 문서, 또는 팀의 집단 기억 속에 살아 있습니다.

이러한 맥락이 없으면, 천재적인 견습생은 기술적으로 컴파일은 되지만 팀의 가장 중요한 규칙을 위반하는 작동 가능한 기능을 만들어낼 수 있습니다. 이는 건축가가 도시의 특정 구역법 (zoning law) 을 알지 못해 잘못된 종류의 벽돌로 아름다운 집을 짓는 것과 같습니다.

실험: 두 가지 접근법

이 논문의 저자들은 AI 에게 이러한 '암묵적인 규칙'에 대한 접근 권한을 부여하는 것이 도움이 되는지 확인하기 위해 테스트를 설계했습니다. 그들은 '어두운 모드 토글 추가'나 '검색창 만들기'와 같은 8 가지 다른 작업이 포함된 시뮬레이션된 사무실 환경 (코드 저장소) 을 만들었습니다. 이러한 작업들 안에는 AI 가 완벽한 점수를 받기 위해 따라야 하는 41 개의 특정 '함정'이나 규칙이 숨겨져 있었습니다.

그들은 두 가지 버전의 AI 를 테스트했습니다:

  1. "코드만" 보는 견습생 (기준): 이 AI 에게 코드 파일만 제공되고 "이를 구축하라"고 지시받았습니다. 이 AI 는 기존 코드 패턴을 살펴봄으로써 규칙을 추측해야 했습니다.
  2. "맥락 인식" 견습생 (증강): 이 AI 는 동일한 코드 파일을 가지고 있었지만, 또한 '회사 핸드북'(Brief라고 명명됨) 을 가지고 있었습니다. 단 한 줄의 코드도 작성하기 전에 이 AI 는 "우리의 설계 규칙은 무엇입니까?" 또는 "고객들은 무엇을 불평합니까?"와 같은 질문을 할 수 있었습니다. 또한 시작하기 전에 단계별 계획 (명세) 이 작성되어 있었습니다.

결과: 엄청난 도약

차이는 극적이었습니다.

  • "코드만" 보는 견습생은 규칙을 **46%**의 경우에만 준수했습니다. 종종 보이지 않는 규칙을 놓쳤습니다. 예를 들어, 한 작업에서 코드를 살펴본 후 페이지네이션을 위한 헬퍼 함수를 발견하고 "아, 이건 이미 완료된 거구나!"라고 판단하여 코드를 전혀 작성하지 않았습니다. 이는 현재 페이지네이션이 고장 나 있어 특정 수정이 필요하다는 사실을 놓친 것이었습니다.
  • "맥락 인식" 견습생은 규칙을 **95%**의 경우 준수했습니다. '핸드북'을 확인함으로써 어떤 위젯을 사용해야 하는지, 어떤 보안 로그를 추가해야 하는지, 그리고 코드를 어떻게 구조화해야 하는지 정확히 알 수 있었습니다.

큰 승리: 맥락 인식 버전은 준수율을 49 퍼센트 포인트 향상시켰습니다.

왜 발생했는가: '보이지 않는' 규칙 vs '보이는' 규칙

논문의 연구 결과는 명확한 패턴을 발견했습니다:

  • 보이는 규칙: 규칙이 코드 내부의 주석에 작성되어 있다면 (예: "보안을 위해 이 함수를 사용하세요"), 견습생 모두 이를 발견하고 100% 의 경우 준수했습니다.
  • 보이지 않는 규칙: 규칙이 제품 문서에만 존재한다면 (예: "우리는 기능 플래그에 PostHog 를 사용하지만, 이는 코드에 포함되어 있지 않습니다"), '코드만' 보는 견습생은 **0%**의 경우에만 이를 파악했습니다. 반면 '맥락 인식' 견습생은 시작하기 전에 규칙을 찾아보았기 때문에 **100%**의 경우 파악했습니다.

단순히 규칙을 '알는' 것 이상의 문제

논문은 또한 '맥락 인식' AI 가 단순히 규칙을 '찾아본' 것뿐만 아니라, 다르게 작동했다고 지적합니다. 코딩하기 전에 요구사항의 체크리스트가 포함된 상세한 계획 (명세) 을 작성했습니다. 또한 '중간 건설 상담'을 통해 작업 중에 "내가 이것을 올바르게 하고 있는가?"라고 멈추고 질문할 수 있었습니다.

저자들은 성공의 어느 정도가 정보를 보유한 데서 비롯되었는지, 아니면 더 나은 워크플로우를 가졌기 때문인지 완벽하게 분리할 수는 없다고 인정합니다. 그러나 데이터는 강력하게 올바른 정보 (제품 맥락) 를 보유하는 것이 다른 AI 가 보지 못했던 문제를 해결하는 핵심임을 시사합니다.

'옳음'의 비용

흥미롭게도 '맥락 인식' AI 는 핸드북을 읽고 계획을 작성하는 데 시간을 보냈기 때문에 실행 비용이 약간 더 들었습니다 (API 비용이 약 28% 더 증가). 그러나 즉시 메인 프로젝트에 병합할 준비가 된 코드를 생산했기 때문에 성공적인 작업당 비용은 실제로 68% 감소했습니다.

'코드만' 보는 AI 는 시도당 비용은 더 저렴했지만, 인간이 수정하고 다시 작성해야 하는 코드를 생산하여 장기적으로는 더 비쌌습니다. '맥락 인식' AI 는 더 많은 코드를 작성하고, 테스트를 작성하며, 폐기된 패턴을 피했기 때문에 100% '병합 준비 완료' 상태였습니다.

결론

이 논문은 개념 증명 (proof-of-concept) 입니다. 이는 AI 코딩 에이전트가 전문 팀에서 진정으로 유용해지기 위해서는 코드만 읽어서는 안 된다는 것을 보여줍니다. 코드 파일 외부에 존재하는 조직적 지식—의사결정, 고객 불만, 설계 선호도, 보안 규칙—에 접근할 수 있어야 합니다.

AI 에게 '전체 그림'을 제공하면, AI 는 추측을 멈추고 팀이 실제로 필요로 하는 것을 정확히 구축하기 시작합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →