Benchmarking Mythos-Linked Bug Rediscovery
본 논문은 세 개의 AI 모델이 Anthropic 의 "Mythos"자료와 관련된 여섯 가지 특정 버그를 수정 사항에 대한 사전 지식 없이 재발견하려 시도한 통제된 실험을 보고하며, 이는 유리한 조건에서도 모델들이 실제 패치로 수정된 구체적인 불변량을 식별하기보다는 그럴듯하지만 잘못된 가설에 매몰되는 경향으로 인해 성공률이 낮았음 (54 회 시도 중 6 회 성공) 을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
고급 기술을 갖춘 탐정들 (AI 모델) 이 최근 전 세계 가장 중요한 소프트웨어 시스템—예를 들어 스마트폰의 운영체제나 영화를 스트리밍하는 엔진—에 숨겨진 결함을 찾아낼 수 있다고 주장했다고 상상해 보세요. 그들은 리눅스 (Linux), FreeBSD, FFmpeg 와 같은 시스템의 코드에서 구체적이고 위험한 버그를 발견했다는 이야기를 발표했습니다.
일부 사람들은 이러한 AI 들이 초지능 해커라고 생각하며 놀라워했고, 다른 사람들은 그 이야기들이 단순한 마케팅 수사에 불과하다고 회의적으로 바라봤습니다.
이 논문은 그 논쟁을 종식시키기 위해 설계된 통제된 실험입니다. AI 가 거대한 코드 도서관을 헤매며 건초더미에서 바늘을 찾는 대신, 연구자들은 AI 에게 바늘이 숨겨진 정확한 책을 건네주었습니다. 그들은 이렇게 질문했습니다. "버그가 포함된 특정 파일을 당신에게 직접 건네준다면, 당신은 여전히 정확한 문제를 찾아낼 수 있을까요?"
간단한 비유를 사용하여 실험의 구성과 결과를 다음과 같이 정리해 보겠습니다.
설정: "타겟 파일" 테스트
소프트웨어 코드를 복잡한 기계를 위한 4,000 페이지 분량의 거대한 설명서라고 생각해 보세요.
- 주장: AI(Mythos) 는 이 설명서에서 기기가 폭발하게 만들 특정 오타를 찾아낼 수 있다고 했습니다.
- 실험: 연구자들은 설명서에서 오타가 있는 특정 페이지를 찾아, 오직 그 페이지만 세 명의 다른 AI 탐정에게 건네주었습니다.
- GPT-5.5 xhigh(추론 모델)
- Claude Opus 4.7(Anthropic 모델)
- Kimi K2(중국산 모델)
그들은 다음과 같은 동일한 규칙을 적용했습니다. 인터넷 접속 불가, 버그에 대한 힌트 제공 불가, 그리고 인간이 공개된 패치에서 이미 수정한 정확한 실수를 찾아내야 함. 그들은 6 가지 다른 "버그"에 대해 각각 3 번씩 시도했습니다.
결과: 누가 바늘을 찾았는가?
총 54 회 시도 (모델 3 개 × 버그 6 개 × 시도 3 회) 중:
- GPT-5.5 xhigh: 정확한 버그를 5 번 찾았습니다. 6 가지 버그 중 2 가지를 완벽하게 해결했으며, 한 번은 같은 파일 내의 다른 버그를 발견했습니다 (목표는 틀렸지만 여전히 실제 발견임).
- Claude Opus 4.7: 정확한 버그를 1 번 찾았습니다. 6 가지 버그 중 1 가지를 해결했습니다.
- Kimi K2: 정확한 버그를 0 번 찾았습니다. 아무것도 찾지 못했습니다.
"왜": 그럴듯한 방해 요소의 함정
이 논문에서 가장 흥미로운 부분은 누가 이겼는지뿐만 아니라, 어떻게 실패했는지입니다.
자동차 엔진을 보고 있다고 상상해 보세요. 당신은 어딘가에 고장 난 볼트가 있다는 것을 알고 있습니다.
- AI 의 실수: AI 는 엔진을 살펴보고 느슨한 전선, 더러운 필터, 약간 마모된 가스켓을 보았습니다. 그리고 "문제를 찾았습니다! 느슨한 전선입니다!"라고 말했습니다.
- 현실: 느슨한 전선은 그럴듯한 문제였지만, 연구자들이 찾고 있던 특정 고장 난 볼트는 아니었습니다.
이 논문은 이를 **"가장 그럴듯한 대안 후보들에 대한 조기 몰입"**이라고 부릅니다.
AI 모델들은 코드를 살펴보고 "이건 의심스러워 보이네요!"라고 말하는 데는 능했습니다. 그들은 버그일 수도 있는 많은 것들을 찾아냈습니다. 하지만 실제 세계의 수정 사항과 일치하는 단 하나의 특정 항목을 골라내는 데는 어려움을 겪었습니다. 그들은 그들이 사냥하던 특정 버그가 아니지만 버그처럼 보이는 "붉은 청어 (오해의 소지가 있는 단서)"들에 의해 주의를 산만하게 했습니다.
사냥의 비용
이 실험은 얼마나 많은 "연료"(비용과 컴퓨팅 파워) 가 소요되었는지도 추적했습니다.
- GPT-5.5는 약 $61이 들었습니다.
- Claude는 약 $88로 가장 비쌌습니다.
- Kimi는 $3.50으로 가장 저렴했지만, 아무것도 찾지 못했습니다.
연구자들이 AI 에게 정확한 파일을 건네주어 (가장 어려운 부분인 파일 찾기 제거) 작업의 난이도를 낮췄음에도 불구하고, AI 는 여전히 정확한 오류를 pinpoint 하는 데 어려움을 겪었습니다.
결론
이 논문은 AI 가 무용지물이라고 말하지도, 원래의 "Mythos" 이야기들이 가짜였다고 말하지도 않습니다. 단순히 다음과 같이 말합니다.
"AI 에게 올바른 파일을 주는 것만으로는 부족합니다."
AI 가 정확히 어디를 봐야 하는지 알고 있더라도, 종종 잘못된 세부 사항에 매몰됩니다. AI 는 많은 "아마도-버그"들을 생성할 수 있지만, 특정 증거와 일치하는 단 하나의 진짜 버그를 선택하는 데는 어려움을 겪습니다. 이 논문은 이러한 AI 버그 사냥꾼들의 성공은 모델 자체의 raw intelligence(원시 지능) 보다는 프로세스(얼마나 많은 시도를 허용받는지, 어떻게 순위가 매겨지는지, 어떻게 안내받는지) 에 크게 의존한다고 결론 내립니다.
요약하자면: AI 는 설명서를 읽을 수 있는 똑똑한 탐정이지만, 정확한 오타를 찾기 위해서는 여전히 매우 구체적인 지시 사항이 필요합니다. 그렇지 않으면 단순히 페이지에 있는 가장 가까운 얼룩을 가리킬 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.