최근 '코파일럿 (Copilot)'이나 '코드엑스 (Codex)' 같은 AI 프로그램들이 개발자들을 도와 코드를 짜고 수정해 주고 있습니다. 하지만 이 AI 들이 **모바일 앱 (안드로이드 vs 아이폰)**을 만들 때 어떻게 작동하는지는 아직 잘 알려지지 않았습니다.
연구팀은 GitHub 에 있는 오픈소스 프로젝트 193 개를 분석하여, AI 가 작성한 **2,901 개의 코드 수정 제안 (PR)**을 살펴봤습니다.
🔍 주요 발견 1: "안드로이드는 열정적, 아이폰은 엄격한 심사관"
안드로이드 (Android):
상황: AI 가 제안한 코드 수정 건수가 아이폰보다 2 배 더 많았습니다.
결과: 제안된 코드 중 71% 가 승인되었습니다.
비유: 안드로이드 개발자들은 AI 를 "열정적인 인턴"처럼 대합니다. "이거 좀 고쳐볼까?"라고 제안하면 대부분 "좋아, 한번 해보자!"라고 받아줍니다. 특히 **코덱스 (Codex)**라는 AI 가 가장 인기가 많았습니다.
아이폰 (iOS):
상황: AI 제안 건수는 적었고, 승인율은 **63%**로 안드로이드보다 낮았습니다.
결과: 어떤 AI 가 제안하든 승인율이 비슷하게 낮았습니다.
비유: 아이폰 개발자들은 AI 를 "엄격한 심사관"처럼 대합니다. "디자인 가이드라인이 너무 엄격해서, AI 가 아무리 열심히 해도 통과가 어렵다"는 뜻입니다. 어떤 AI 도 특별히 잘하는 게 없었습니다.
🔍 주요 발견 2: "일하는 종류에 따른 반응 차이"
AI 가 어떤 일을 하느냐에 따라 승인이 달라졌습니다.
잘 통하는 일 (승인율 높음):
비유: "화장실 청소", "문고리 닦기", "간단한 문구 수정" 같은 단순 반복 업무입니다.
실제: 기능 추가 (Feature), 버그 수정 (Fix), UI 디자인, 지역화 (언어 변경) 같은 작업은 AI 가 잘해서 승인받기 쉽습니다.
어려운 일 (승인율 낮음, 시간 걸림):
비유: "건물 구조를 바꾸는 리모델링"이나 "전기 배선 재작업" 같은 거창한 구조 변경입니다.
실제: 코드 구조를 바꾸는 리팩토링 (Refactor) 이나 빌드 설정 변경은 AI 가 잘 못해서 거절당하거나, 승인되더라도 해결하는 데 시간이 매우 오래 걸립니다.
🔍 주요 발견 3: "시간 흐름에 따른 변화"
안드로이드: 2025 년 중반까지는 AI 가 일하는 속도가 점점 빨라졌는데, 그 이후에 다시 느려졌습니다. 마치 인턴이 처음엔 열심히 하다가 중간에 지쳐서 다시 느려진 것 같습니다.
아이폰: 속도는 안드로이드보다 훨씬 빨랐지만, 시간이 지나도 큰 변화가 없었습니다. 일관되게 빠르지만, AI 가 아무리 노력해도 아이폰의 높은 벽을 넘기 힘들다는 뜻입니다.
💡 이 연구가 우리에게 주는 교훈
플랫폼을 고려해야 합니다: 안드로이드에서는 "어떤 AI 를 쓰느냐"가 중요하지만, 아이폰에서는 "어떤 AI 를 쓰든 다 비슷하다"는 결론입니다.
일감을 잘 나누세요: AI 에게는 "간단한 버그 수정"이나 "UI 다듬기" 같은 일을 맡기는 게 가장 효율적입니다. 하지만 "시스템 전체를 개편"하는 일은 아직 인간이 직접 챙기는 게 낫습니다.
아이폰은 더 조심해야 합니다: 아이폰 개발자들은 AI 가 제안한 코드를 더 신중하게 검토해야 합니다.
🏁 결론
이 연구는 **"AI 가 모바일 앱 개발을 완전히 대체할 수는 없지만, 단순하고 반복적인 일에서는 훌륭한 조수"**가 될 수 있음을 보여줍니다. 다만, 안드로이드와 아이폰이라는 두 가지 다른 환경 (문화) 에 따라 AI 의 활약상이 완전히 다르다는 점을 기억해야 합니다.
마치 한국 식당과 프랑스 식당에 같은 요리사가 들어갔을 때, 메뉴와 주방 규칙에 따라 그 요리사의 실력이 다르게 평가받는 것과 비슷하다고 할 수 있습니다.
1. 연구 배경 및 문제 정의 (Problem)
배경: Codex, Copilot 등 AI 코딩 에이전트가 소프트웨어 개발에 광범위하게 기여하고 있으며, AIDev 와 같은 대규모 데이터셋을 통해 에이전트 생성 PR(풀 리퀘스트) 의 거시적 분석이 가능해졌습니다.
문제: 모바일 앱 개발 (Android, iOS) 은 디자인, 로직, 하드웨어 구성이 복잡하고 플랫폼별 빌드 시스템, 언어 생태계, 프로젝트 구조, CI 워크플로우가 상이합니다. 그러나 기존 연구는 범용 소프트웨어에 집중했을 뿐, 모바일 플랫폼별 AI 에이전트의 행동 양식과 수용성에 대한 실증적 연구는 전무했습니다.
목표: 오픈소스 모바일 프로젝트에서 AI 에이전트가 생성한 코드의 수용률 (PR acceptance rate) 과 해결 시간 (resolution time) 이 플랫폼 (Android vs iOS), 에이전트, 작업 유형에 따라 어떻게 다른지 실증적으로 규명하는 것.
2. 연구 방법론 (Methodology)
이 연구는 4 단계의 체계적인 프로세스를 통해 수행되었습니다.
데이터셋 구성:
원천 데이터: AIDev 데이터셋 (932,000 개의 AI 작성 PR 포함) 을 기반으로 함.
확장: AIDev 의 시간적 범위 (2025 년 5 월7 월) 가 제한적이므로, GitHub API 를 활용하여 2025 년 8 월11 월의 추가 PR 을 수집하여 총 2,901 개의 AI 작성 PR을 확보함.
대상 프로젝트: Java/Kotlin (Android) 및 Swift/Obj-C (iOS) 로 작성된 193 개의 검증된 오픈소스 저장소 (Android 98 개, iOS 95 개).
필터링 조건: 10 개 이상의 스타를 가진 프로젝트, 튜토리얼/샘플 프로젝트 제외, AndroidManifest.xml, gradle, Podfile, Info.plist 등 플랫폼 특화 파일 존재 확인.
작업 분류 (Categorization):
284 개의 PR 샘플을 GPT-5 를 활용한 오픈 카드 정렬 (Open-card sorting) 로 초기 분류.
연구자들이 이를 검토하여 13 가지 작업 카테고리 (feature, fix, refactor, build, chore, performance, style, test, docs, operations, ui, localization, other) 로 최종 확정.
전체 PR 에 대해 GPT-5 를 활용한 클로즈드 카드 정렬을 수행하고, 284 개 샘플에 대한 Cohen's κ (0.877) 를 통해 높은 일관성을 검증.
통계 분석:
지표: PR 수용률 (Acceptance Rate), PR 해결 시간 (Resolution Time).
플랫폼 차이:Android 프로젝트가 iOS보다 AI 작성 PR 수용률이 높음 (Android: 71%, iOS: 63%). iOS 는 엄격한 디자인 가이드라인과 개발 환경으로 인해 수용이 더 까다로울 것으로 추정됨.
에이전트 차이:
Android: 에이전트별 성능 차이가 유의미함. Codex가 가장 높은 수용률 (76.8%) 을 보인 반면, Copilot(28.0%) 과 Cursor(42.3%) 는 상대적으로 낮음.
iOS: 에이전트 간 수용률 차이가 미미함 (51~79% 범위 내 균일).
RQ2: 작업 카테고리별 PR 수용률 차이
Android: 카테고리별 수용률 편차가 큼.
높은 수용률: Localization(100%), UI(88%), Fix(75%) 등 루틴 작업.
낮은 수용률: Refactor, Feature, Build 등 구조적 변경 작업.
iOS: 카테고리별 수용률에 유의미한 차이가 없음. 모든 작업 유형에서 수용 행동이 균일하게 나타남.
RQ3: 시간에 따른 PR 해결 시간 (Resolution Time) 추이
플랫폼 속도: iOS 가 Android 보다 PR 해결 속도가 18 배 빠름.
시간적 추이 (2025 년 5 월~11 월):
Android: 5 월부터 8 월까지 해결 시간이 개선되었으나, 이후 다시 악화되는 불안정한 추이를 보임. 기능적 (Functional) PR 이 비기능적 (Non-functional) PR 보다 400 배 빠르게 해결됨.
iOS: 통계적으로 유의미하지만 시각적으로 미미한 월별 변동성. 기능적 PR 이 비기능적 PR 보다 7 배 빠름.
에이전트 성능:Codex가 두 플랫폼 모두에서 다른 에이전트보다 PR 해결 속도가 빠름 (Android 에서 Claude 보다 3 배 빠름).
4. 주요 기여 및 의의 (Contributions & Significance)
최초의 모바일 특화 실증 연구: 오픈소스 모바일 프로젝트에서 AI 에이전트 생성 코드의 거동을 분석한 최초의 카테고리 수준 (Category-level) 연구.
플랫폼 인식형 에이전트 시스템의 기초: Android 는 에이전트 선택과 작업 유형에 민감한 반면, iOS 는 전반적으로 보수적이고 균일한 수용 패턴을 보인다는 사실을 규명. 이는 차세대 플랫폼 인식형 에이전트 시스템 설계에 중요한 기준 (Baseline) 을 제공.
실무적 통찰:
Android: 루틴 작업 (수정, UI, 로컬라이제이션) 에 AI 자동화를 집중하고, 구조적 변경 (리팩토링 등) 에는 인간 검토자의 추가 노력을 할당하는 전략 수립 가능.
iOS: 특정 에이전트나 작업 유형에 따른 최적화보다는 전반적인 신중한 검토 프로세스가 필요함을 시사.
데이터 및 코드 공개: 연구의 재현성을 위해 데이터와 분석 코드를 공개 (Replication Kit).
5. 결론
이 연구는 AI 코딩 에이전트가 모바일 개발에 미치는 영향이 플랫폼 (Android vs iOS) 과 작업 유형에 따라 현저히 다름을 입증했습니다. Android 는 에이전트와 작업 유형에 따라 수용률과 해결 시간의 편차가 크고 역동적인 반면, iOS 는 상대적으로 일관되고 보수적인 수용 패턴을 보입니다. 이러한 발견은 오픈소스 유지보수자가 리뷰 워크플로우를 최적화하고, 에이전트 기반 개발 도구를 더 효과적으로 통합하는 데 필수적인 근거를 제공합니다.