← 최신 논문
🤖 machine learning

Is Model Instability just Noise to be Tolerated or a Property that can be Managed?

이 논문은 소프트웨어 공학 최적화에서의 모델 불안정성이 단순한 노이즈가 아니라 관리 가능한 속성임을 주장하며, 모델 설정에 대한 전략적 조정이 데이터 특성에 의해 부과되는 근본적인 한계를 인정하면서도 일관성과 추천 품질을 유의미하게 향상시킬 수 있음을 입증한다.

원저자: Amirali Rayegan, Lunxiao Li, Tim Menzies

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Amirali Rayegan, Lunxiao Li, Tim Menzies

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수퍼 스마트한 컴퓨터 비서와 함께 미스터리를 해결하려는 탐정이라고 상상해 보십시오. 당신은 매일 컴퓨터에 동일한 단서(데이터)를 입력하고 최적의 용의자(최적의 해답)를 찾아달라고 요청합니다. 그러면 당신은 컴퓨터가 매번 똑같은 답을 내놓을 것이라고 기대하겠죠, 그렇죠?

하지만 꼭 그렇지만은 않습니다. 소프트웨어 공학의 세계에서 이 컴퓨터 비서는 사실 기분 변화가 심한 편입니다. 만약 당신이 동일한 데이터로 분석을 두 번 실행한다면, 설령 정확히 같은 데이터를 사용했더라도 컴퓨터는 완전히 다른 이야기, 다른 용의자 목록, 그리고 다른 결론을 가지고 돌아오는 경우가 많습니다.

노스캐롤라이나 주립대학교 연구진이 작성한 이 논문은 다음을 알아내기 위해 거대한 탐정 놀이를 시작합니다. 이 혼란은 우리가 감수해야 할 단순한 배경 소음일까요, 아니면 실제로 고칠 수 있는 글리치(오류)일까요?

위대한 "라쇼몽" 미스터리

먼저, 저자들은 127개의 서로 다른 소프트웨어 문제(비디오 게임 엔진 튜닝, 프로젝트 지연 예측, 버그 찾기 등)를 살펴보았습니다. 그들은 각 문제에 대해 최고의 소프트웨어 옵티마이저를 20번씩 실행했습니다.

충격적인 사실은 다음과 같습니다. 표준(기본) 설정 하에서, 이 20번의 실행 결과가 최종 정답에 대해 일치한 경우는 테스트 케이스의 단 **2.9%**뿐이었습니다. 실제로 대부분의 문제에서 컴퓨터는 당신이 물을 때마다 매번 다른 권장 사항을 내놓고 있었습니다. 이는 마치 날씨 앱에 일기 예보를 20번 물어봤는데 "맑음", "눈", "비", "토네이도"가 무작위 순서로 돌아오는 것과 같습니다.

연구진은 이것이 단순한 버그가 아니라고 주장합니다. 이것은 데이터 자체의 특성입니다. 그들은 이를 라쇼몽 효과(동일한 사건에 대해 네 명의 목격자가 각기 다른 이야기를 하는 유명한 영화에서 이름을 따옴)라고 부릅니다. 소프트웨어에서는 데이터를 거의 비슷하게 설명할 수 있는 수천 개의 서로 다른 "모델(이야기)"이 존재하는 경우가 많습니다. 너무 많은 "충분히 괜찮은" 답들이 존재하기 때문에, 컴퓨터가 작업을 시작하는 방식의 아주 미세한 변화(예: 난수 시드 값)만으로도 컴퓨터를 완전히 다른 경로로 인도하게 됩니다.

그들이 배제한 것들

해결책을 찾기 전, 그들은 몇 가지 잘못된 생각들을 정리해야 했습니다.

  • 정답의 "형태" 문제가 아니다: 당신은 컴퓨터가 내부 로직(의사결정 트리의 형태)을 바꾼다면 그것이 문제일 것이라고 생각할 수도 있습니다. 하지만 연구진은 정답을 일관되게 고정하더라도 내부 로직은 매번 완전히 다르게 보인다는 것을 발견했습니다. 따라서 컴퓨터가 정확히 똑같은 "이야기 구조"를 사용하도록 강제하려는 노력은 시간 낭비입니다.
  • 단순히 "학습 능력이 부족한" 문제가 아니다: 그들은 "인과 관계 추론"(컴퓨터에게 원인과 결과에 대해 가르치는 것)을 추가하거나 데이터를 클러스터로 그룹화하는 등의 정교한 기술을 시도했습니다. 이것들은 약간의 도움이 되었지만 문제를 완전히 해결하지는 못했습니다. 이는 불안정성의 일부가 노이즈, 누락된 레이블, 혹은 단순히 가능한 답의 엄청난 숫자처럼 데이터 자체에 내재되어 있음을 시사합니다.

"튜닝"의 마법

만약 우리가 컴퓨터가 다른 이야기를 하는 것을 막을 수 없다면, 적어도 컴퓨터가 우리에게 똑같은 조언을 하게 만들 수는 없을까요?

정답은 입니다. 하지만 이는 컴퓨터가 게임을 플레이하는 방식을 바꾸어야 한다는 것을 의미합니다. 연구진은 네 가지 특정 "노브(조절 손잡이)"를 돌려 테스트했습니다:

  1. 레이블을 보는 양: 방대한 데이터 더미를 보는 대신, 더 작고 똑똑한 50개의 사례(기본값 20개에서 증가)로 제한했습니다.
  2. 새로운 데이터를 선택하는 방식: 탐욕적으로 가장 좋아 보이는 데이터를 고르는 대신(이는 함정이 될 수 있음), 현재의 "최선의 추측"과 가장 가까운 데이터를 고르도록 지시했습니다.
  3. 트리의 복잡도: 의사결정 트리를 약간 더 단순하게 만들었습니다(트리가 너무 깊어져서 미세한 세부 사항까지 쫓아가는 것을 방지함).
  4. 데이터를 분할하는 방식: 매우 민감하게 반응하는 "엔트로피(Entropy)"라는 수학 공식 대신, 더 차분한 "지니(Gini)" 공식을 사용했습니다.

결과는 어땠을까요?
이 네 가지 노브를 조절했을 때, 컴퓨터의 권장 사항은 4.8배 더 일관성 있게 변했습니다.

  • 기본 설정 하에서 12,700개의 테스트 케이스 중 단 364개에서만 일치했던 것에 비해, 새로운 **정제된 설정(refined settings)**은 1,740개의 케이스에서 일치하는 결과를 냈습니다 (**13.7%**의 일치율).
  • 결과의 "흔들림(표준 편차)"은 22% 감소했습니다.
  • 가장 좋은 점은 조언의 품질이 나빠지지 않았다는 것입니다. 오히려 더 좋아졌습니다. 새로운 설정은 기존 설정이 74개였던 것에 비해, 127개 중 119개의 데이터셋에서 "최상위 순위"의 선택을 받았습니다.

핵심 요점

이 논문은 우리가 컴퓨터를 완벽하게 안정적으로 만들 수는 없다고 결론짓습니다. 최상의 정제된 설정을 사용하더라도, 여전히 특정 테스트 케이스에 대해 약 13.7% 정도만 일치하며, 그들이 시도한 가장 안정적인 방법(클러스터링)조차 51% 미만의 일치율을 보였습니다.

따라서 교훈은 우리가 이 불안정성을 완전히 "고칠" 수 없다는 것이 아닙니다. 교훈은 이것을 무시해야 할 버그로 취급해서는 안 된다는 것입니다. 대신, 안정성을 표준 성적표 항목으로 취급해야 합니다. 소프트웨어 도구가 당신에게 답을 줄 때, 당신은 이렇게 물어야 합니다. "이 도구는 이 답을 얼마나 자주 내놓는가?"

만약 도구가 불안정하다면, 단 한 번의 실행 결과만을 믿어서는 안 됩니다. 여러 번 실행해 보고 계속해서 나타나는 조언을 찾아야 합니다. 연구진은 향후 모든 소프트웨어 최적화 논문이 성능 수치와 함께 이 "일치율(agreement rate)"을 함께 보고해야 한다고 제안합니다. 그래야 우리가 언제 컴퓨터를 믿고 언제 회의적으로 바라봐야 할지 알 수 있기 때문입니다.

요약하자면, 컴퓨터는 약간의 드라마 퀸(과장된 행동을 하는 사람) 같지만, 만약 당신이 그와 대화하는 법(그 네 가지 노브를 조절하는 법)을 안다면, 비록 매번 약간 다른 이야기를 할지라도 훨씬 더 신뢰할 수 있는 조언을 해줄 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →