← 최신 논문
💻 computer science

Can LLMs Produce Better Object-Oriented Designs than Human-Involved Development?

본 연구는 사전-LLM, 사후-LLM, 순수-LLM 자바 프로젝트 간의 객체지향 설계 품질을 비교하여, LLM 생성 코드는 복잡도가 낮고 코드 스멜이 적지만 과도한 단순화와 약한 책임 분리로 인한 문제를 종종 겪으며, 이는 설계 분해 과정에서 인간의 지도가 여전히 필요함을 시사한다고 밝혔다.

원저자: Zushuai Zhang, Elliott Wen, Ewan Tempero

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zushuai Zhang, Elliott Wen, Ewan Tempero

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 복잡한 집을 짓도록 임명된 마스터 건축가라고 상상해 보세요. 실제 시공을 수행할 세 가지 다른 팀이 있습니다:

  1. 구식 경비 (PreAI): 컴퓨터 보조 도구를 한 번도 사용해 본 적이 없는 숙련된 건설 노동자들입니다. 그들은 직접 청사진을 그리고 모든 것을 손으로 짓습니다.
  2. 하이브리드 크루 (PostAI): 강력한 컴퓨터 보조 도구를 이제 갖게 된 숙련된 건설 노동자들입니다. 그들은 여전히 청사진을 그리고 주요 결정을 내리지만, 벽돌을 쌓고 나무를 자르는 작업은 컴퓨터가 도와주도록 합니다.
  3. 로봇 팀 (PureAI): 집의 간단한 구두 설명을 받아 인간이 도구를 만지지 않은 채 처음부터 끝까지 집 전체를 짓는 고급 로봇 팀입니다.

이 논문은 단순한 질문을 던집니다: 어떤 팀이 가장 좋은 집을 짓나요? 구체적으로, "로봇 팀"이 인간 팀만큼 좋거나 심지어 더 나은 설계를 만들어 낼까요?

실험

연구자들은 칼라 (Kalah) 라는 고전 보드 게임을 사용하여 "건설 챌린지"를 설정했습니다. 그들은 세 그룹에게 이 게임을 플레이하는 자바 (Java) 소프트웨어 프로그램을 만들도록 요청했습니다:

  • 그룹 1 (PreAI): AI 코딩 도구가 보편화되기 전인 2021 년 학생들.
  • 그룹 2 (PostAI): AI 도구가 대중화된 후인 2024 년 학생들.
  • 그룹 3 (PureAI): 동일한 과제를 세 가지 최상위 AI 모델에 부여하여, 모델들이 코드를 완전히 자체적으로 생성하도록 했습니다.

그들은 게임이 작동하는지 여부만 확인한 것이 아니라 디자인의 품질을 살펴보았습니다. 이는 집의 레이아웃이 논리적인지, 방들이 적절한 크기인지, 그리고 배관이 엉켜있지 않은지 확인하는 것과 같습니다.

그들이 발견한 것

1. 로봇 팀은 "작은" 집을 지었지만, 너무 단순했습니다

PureAI(로봇) 팀이 만든 코드는 표면상 매우 깔끔해 보였습니다.

  • 좋은 소식: 그들의 코드는 "냄새"(지저분한 코드 같은 나쁜 습관) 가 적고 전체적으로 덜 복잡한 것처럼 보였습니다. 벽이 거의 없고 매우 열린 평면도를 가진 집과 같았습니다.
  • 나쁜 소식: 이 단순성은 실제로 문제였습니다. 로봇들은 설계가 지나치게 단순화되었습니다. 로봇들은 "플레이어", "보드", "구멍 (게임 속 구멍)"을 위한 별도의 방을 짓는 대신, 종종 모든 것을 하나 또는 두 개의 거대한 방으로 합쳐버렸습니다.
  • 비유: 주방, 침실, 화장실이 문 하나 없이 하나의 거대한 방으로만 이루어진 집을 상상해 보세요. 매우 단순하고 청소하기 쉽습니다 (낮은 복잡성). 하지만 활동을 분리할 수 없기 때문에 (나쁜 "책임 분리") 살기에는 끔찍합니다. 로봇들은 시스템을 이해 가능하게 만드는 중요한 "추상화 (distinct concepts)"를 놓쳤습니다.

2. 하이브리드 크루 (PostAI) 가 로봇처럼 행동하기 시작했습니다

AI 도구를 사용한 2024 년 학생들은 PureAI 팀만큼 "로봇처럼" 짓지는 않았지만, 2021 년 학생들보다 로봇에 더 가까웠습니다.

  • 그들의 디자인도 2021 년 학생들이 포함했던 일부 고유한 "방 (개념)"을 놓치면서 조금 너무 단순해지고 있었습니다.
  • 그러나 로봇들과 달리 하이브리드 크루의 코드는 실제로 구식 학생들보다 더 많은 지저분한 습관 (코드 냄새) 을 가지고 있었습니다. 인간이 로봇이 생성한 코드를 수정하거나 편집하려고 할 때, 전체 구조는 단순해 보일지라도 국소적으로 새로운 지저분함을 도입하는 것 같습니다.

3. "프롬프트"는 중요하지만 마법의 지팡이는 아닙니다

연구자들은 로봇들에게 "플레이어용 별도 클래스와 보드용 별도 클래스를 반드시 만들어라"와 같이 더 구체적인 지시를 주었습니다.

  • 결과: 지시가 더 구체적일 때, 로봇들은 별도의 "방 (개념)"을 만드는 데 더 잘 수행했습니다.
  • 한계: 최고의 지시를 주더라도 로봇들은 여전히 인간이 설계한 집의 품질을 완전히 따라잡지는 못했습니다. 그들은 여전히 단순화하는 경향이 있었습니다.

핵심 교훈

로봇은 벽돌을 쌓는 데 뛰어나지만, 청사진을 그리는 데는 여전히 인간이 필요합니다.

이 논문은 AI 가 작동하고 깔끔해 보이는 코드를 작성할 수는 있지만, 객체 지향 설계의 큰 그림을 다루는 데는 어려움을 겪는다고 결론 내립니다. AI 는 "단순함"을 만들기 위해 모든 것을 뭉개는 경향이 있는데, 이는 시스템의 고유한 부분이 사라지기 때문에 나중에 소프트웨어 유지보수를 더 어렵게 만듭니다.

  • PureAI(로봇): 작은 실수를 피하는 데는 뛰어나지만, 큰 구조를 이해하는 데는 서툴릅니다.
  • PostAI(AI 를 사용하는 인간): 구조적 깊이의 일부를 잃기 시작했으며, 때로는 그 과정에서 코드를 더 지저분하게 만듭니다.
  • 교훈: AI 를 사용하여 소프트웨어를 작성한다면, 당신은 건축가 역할을 해야 합니다. AI 에게 문제를 어떻게 별도의 부분으로 분해 (decomposition) 하고 각 부분이 무엇을 담당해야 하는지 정확히 지시해야 합니다. 단순히 "게임을 만들어라"라고만 말하면, AI 는 나중에 수정하기 어렵지만 깔끔해 보이는 지저분하고 과도하게 단순화된 버전을 만들 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →