← 최신 논문
🤖 machine learning

A Comparative Study of Model Selection Criteria for Symbolic Regression

본 논문은 7 개의 합성 데이터셋에 대한 기호 회귀의 모델 선택 기준에 대한 체계적인 실증 비교를 제시하며, 최소 설명 길이 (MDL) 와 베이지안 정보 기준 (BIC) 이 실제 표현을 식별하고 테스트 오차를 최소화하는 데 가장 효과적인 방법임을 밝혀냅니다.

원저자: Ali Soltani, Gabriel Kronberger, Fabricio Olivetti de Franca, Mattia Billa, Alessandro Lucantonio

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ali Soltani, Gabriel Kronberger, Fabricio Olivetti de Franca, Mattia Billa, Alessandro Lucantonio

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 미스터리를 해결하려는 형사가 되어 상상해 보세요. 당신은 약간 지저분하고 노이즈가 섞인 증거들 (데이터) 의 더미를 가지고 있습니다. 아마도 어떤 발자국은 진흙투성이일 수도 있고, 어떤 목격자 진술에는 몇 가지 오타가 있을지도 모릅니다. 당신의 목표는 발생한 사건들의 정확한 순서 (즉, "진실") 를 재구성하는 것입니다.

컴퓨터 과학의 세계에서는 이를 **기호 회귀 (Symbolic Regression)**라고 부릅니다. 발자국 대신 컴퓨터는 데이터를 설명하는 수학적 공식을 찾습니다. 컴퓨터는 "y = x + 1"과 같은 간단한 것부터 스파게티 그릇처럼 보이는 엄청나게 복잡하고 얽힌 덩어리에 이르기까지 수천 가지의 가능한 공식을 생성합니다.

문제점은 무엇일까요? 컴퓨터는 지저분한 증거들을 암기하는 데 매우 능숙합니다. 진흙투성이 발자국에 완벽하게 맞는 공식을 만들 수 있지만, 만약 새로운 발자국 세트를 보여준다면 그 공식은 처참하게 실패할 것입니다. 이를 **과적합 (overfitting)**이라고 합니다. 이는 연습 시험의 답을 외우지만 개념을 이해하지 못해 실제 시험에서 낙제하는 학생과 같습니다.

그렇다면 컴퓨터가 만든 수천 개의 공식 중에서 최고의 공식을 어떻게 선택할까요? 당신은 최고의 공식을 결정할 규칙이나 심판 역할을 하는 "모델 선택 기준 (Model Selection Criterion)"이 필요합니다.

경쟁자들

이 논문의 저자들은 어떤 "심판"이 가장 잘 작동하는지 보기 위해 경쟁을 개최했습니다. 그들은 알려진 정답을 가진 일곱 가지 다른 미스터리 시나리오 (합성 데이터셋) 를 만들고 거기에 노이즈를 추가했습니다. 그런 다음 컴퓨터에게 일부는 의도적으로 지나치게 복잡하게 만든 (과적합된) 후보 공식들을 포함해 일련의 공식들을 생성하도록 요청했습니다.

그들은 더러운 더미 중에서 정확하고 간단한 공식을 선택할 수 있는 다섯 가지 심판 (기준) 을 테스트했습니다.

  1. MSE (훈련 오차): 이 심판은 현재 지저분한 증거들에 공식이 얼마나 잘 맞는지만 봅니다. 이는 연습 시험만 공부하는 학생과 같습니다. 이는 가장 복잡하고 과적합된 공식들을 선택하는 경향이 있습니다.
  2. AIC (아카이케 정보 기준): 정확성과 단순성 사이의 균형을 맞추려는 고전적인 심판입니다. 공식의 추가 요소 하나하나에 대해 작은 "페널티"를 부과합니다.
  3. AICc: 데이터가 많지 않을 때 조금 더 엄격하도록 설계된 AIC 의 수정 버전입니다.
  4. BIC (베이지안 정보 기준): AIC 보다 더 엄격한 심판입니다. 특히 데이터 양이 증가함에 따라 복잡성에 대해 더 가혹하게 페널티를 부과합니다. 불필요한 부분을 매우 싫어합니다.
  5. MDL (최소 설명 길이): 이 심판은 다음과 같은 교묘한 비유를 사용합니다: "공식과 데이터 모두를 설명하는 가장 짧은 방법은 무엇인가?" 공식이 너무 복잡하면 메시지가 너무 길어집니다. MDL 은 진실에 대한 가장 효율적인 "압축"을 찾습니다.
  6. Errin (부트스트랩 추정): 이는 계산 비용이 가장 많이 드는 심판입니다. 데이터에 무작위 노이즈를 추가하여 공식이 얼마나 흔들리는지 보기 위해 수백 번 실험을 시뮬레이션합니다. 이는 200 번의 병렬 우주에서 실험을 실행하여 확신을 얻는 것과 같습니다.

결과

이 논문은 이러한 심판들을 서로 겨루게 하여 몇 가지 명확한 승자와 패자를 발견했습니다.

  • 패자: 단순한 "훈련 오차 (MSE)"는 끔찍했습니다. 이는 일관되게 가장 복잡하고 과적합된 공식을 선택하여 일반화에 실패했습니다.
  • 강자들: MDLBIC가 챔피언이었습니다.
    • MDL이 가장 일관성이 있었습니다. 거의 항상 가장 간단하고 정확한 공식을 찾았습니다. "노이즈"를 무시하고 진정한 신호를 찾는 데 가장 뛰어났습니다.
    • BIC는 근소한 차이로 2 위를 차지했으며, 역시 정확하고 간단한 공식을 찾는 데 훌륭한 성과를 거두었습니다.
  • 중도: AIC 와 AICc 는 괜찮았지만, MDL 과 BIC 에 비해 복잡성에 대해 조금 더 관대했습니다.
  • 과도한 노력 (지친) 자: Errin은 흥미로웠습니다. 때로는 훌륭하게 작동했지만, 종종 너무 크고 복잡한 공식을 선택했습니다. 게다가 매우 느렸습니다. 1 분 만에 해결될 수 있는 사건을 결정하는 데 일주일이나 걸리는 심판과 같습니다.

핵심 교훈

데이터에서 수학적 공식을 찾는 시스템을 구축한다면, 현재 데이터에 가장 잘 맞는 것만 선택하지 마십시오. 그것은 함정입니다.

대신 기본 선택지로 MDL(최소 설명 길이)을 사용하십시오. 이는 모든 불필요한 부분을 잘라내고 가장 간결하고 정확한 이야기를 남기는 현명한 편집자와 같습니다. MDL 이 특정 문제에 너무 엄격하다고 느껴진다면 BIC가 훌륭한 대안입니다.

이 논문은 모든 시나리오에 완벽한 단일 심판은 없지만, MDL 과 BIC 가 정확할 뿐만 아니라 이해하고 현실 세계에서 유용할 만큼 충분히 간단한 공식을 찾는 데 가장 신뢰할 수 있는 도구라고 결론지었습니다. 이들은 "데이터에 맞추는 것"과 "노이즈를 암기하지 않는 것" 사이의 가장 좋은 균형을 이룹니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →