← 최신 논문
💻 computer science

SWE-Bench Mobile: Can Large Language Model Agents Develop Industry-Level Mobile Applications?

이 논문은 실제 iOS 프로덕션 코드베이스를 기반으로 한 새로운 벤치마크인 'SWE-Bench Mobile'을 통해 대규모 언어 모델(LLM) 에이전트의 산업 수준 모바일 앱 개발 능력을 평가하였으며, 현재의 에이전트 기술이 실제 산업 요구사항에는 여전히 미치지 못한다는 점을 밝혀냈습니다.

원저자: Muxin Tian, Zhe Wang, Blair Yang, Zhenwei Tang, Kunlun Zhu, Honghua Dong, Hanchen Li, Xinni Xie, Guangjing Wang, Jiaxuan You

게시일 2026-02-11
📖 2 분 읽기☕ 가벼운 읽기

원저자: Muxin Tian, Zhe Wang, Blair Yang, Zhenwei Tang, Kunlun Zhu, Honghua Dong, Hanchen Li, Xinni Xie, Guangjing Wang, Jiaxuan You

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 상황 설정: "요리 초보 vs 전문 셰프"

지금까지의 AI 코딩 테스트(HumanEval 등)가 "계란 프라이 만드는 법 알려줄게, 해봐" 같은 아주 단순한 요리법을 물어보는 수준이었다면, 이번에 연구진이 만든 **'SWE-Bench Mobile'**은 완전히 다릅니다.

이 테스트는 마치 **"자, 여기 5성급 호텔 주방이야. 레시피(PRD)랑 완성된 음식 사진(Figma 디자인) 줄 테니까, 이 거대한 주방의 도구들과 재료들을 다 써서 손님이 주문한 코스 요리를 만들어내!"**라고 요구하는 것과 같습니다.

  • 레시피 (PRD): "손님이 이런 맛을 원해요"라는 복잡한 요구사항 문서.
  • 음식 사진 (Figma): "음식은 이렇게 예쁘게 담겨야 해요"라는 디자인 설계도.
  • 거대한 주방 (Codebase): 수십만 개의 재료와 도구가 섞여 있는 엄청나게 큰 코드 뭉치.

2. 테스트 결과: "AI는 아직 '주방 보조' 수준"

연구진은 시중에 나온 유명한 AI 비서들(Cursor, Claude Code 등)을 이 혹독한 주방에 투입했습니다. 결과는 충격적이었습니다.

"가장 똑똑한 AI조차도 10번 중 1번(12%) 정도만 완벽하게 요리를 완성했습니다."

왜 실패했을까요? AI들이 보여준 '실수 패턴'을 비유하자면 이렇습니다.

  • "재료만 준비하고 접시를 안 가져와요" (기능 구현 미흡): 고기는 잘 구웠는데, 정작 손님에게 내놓을 접시나 소스를 준비하는 걸 까먹는 식입니다. (코드의 일부분만 고치고 전체적인 연결을 놓침)
  • "레시피는 읽었는데, 주방 규칙을 몰라요" (산업 표준 미숙): 요리는 잘했는데, 호텔의 '위생 규칙(Feature Flag, 즉 기능을 켰다 껐다 하는 설정)'을 지키지 않아서 주방장이 혼내는 상황입니다.
  • "사진이랑 너무 달라요" (디자인 무시): 맛은 비슷할지 몰라도, 사진 속 음식의 모양(UI 디자인)과는 전혀 딴판인 음식을 내놓는 경우입니다.

3. 이 논문이 발견한 흥စား로운 사실들

  1. "도구가 실력을 만든다" (Agent Design Matters): 똑같은 똑똑한 요리사(모델)를 데려와도, 어떤 주방 시스템(Agent Scaffolding)을 갖춰줬느냐에 따라 실력이 6배나 차이 났습니다. 즉, AI 모델 자체보다 그 AI가 코드를 찾고 수정하는 '방식'이 훨씬 중요하다는 뜻입니다.
  2. "복잡해지면 멘붕이 와요" (Complexity Gap): 재료 1~2개로 만드는 요리는 잘하는데, 재료가 7개 이상 들어가는 복잡한 요리가 되면 성공률이 뚝 떨어집니다. AI가 여러 파일을 동시에 고려하는 '멀티태스킹' 능력이 아직 부족하다는 증거죠.
  3. "너무 친절하게 설명하면 오히려 헷갈려 해요" (Prompting): "자, 이제 1번을 하고, 그다음 2번을 하고..."라며 너무 길고 복잡하게 명령을 내리면, AI가 오히려 갈팡질팡하며 실수를 합니다. 오히려 **"실수하지 말고 꼼꼼하게 해!"(Defensive Programming)**라고 핵심만 짚어주는 게 더 효과적이었습니다.

4. 결론: "AI는 아직 '완성형'이 아닌 '조수'입니다"

이 논문의 결론은 명확합니다. **"AI 코딩 비서는 아직 혼자서 요리를 책임질 셰프가 아니라, 옆에서 재료를 손질해 주는 유능한 조수(Copilot) 단계에 머물러 있다"**는 것입니다.

하지만 연구진은 이 테스트를 통해 AI가 앞으로 어떤 부분을 더 공부해야 하는지(디자인 이해하기, 복잡한 구조 파악하기 등) 아주 구체적인 지도를 그려주었습니다. AI가 진짜 '전문 개발자'가 되는 날을 앞당기기 위한 아주 중요한 이정표라고 할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →