← 최신 논문
💬 NLP

Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning

"Physics-R1" 논문은 기존 다중 모달 물리 평가 파이프라인의 데이터 오염, 번역 편향, 그리고 객관식 문제 포화라는 치명적 결함을 규명하고, 엄격하게 감사된 코퍼스와 새로운 추론 모델을 공개함으로써 새로운 개방형 올림피아드 벤치마크에서 상당한 성능 향상을 달성함으로써 이러한 문제들을 해결합니다.

원저자: Shan Yang

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shan Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능 (AI) 의 세계를 거대하고 고도의 stakes 가 걸린 요리 대회라고 상상해 보세요. 목표는 어떤 AI '셰프' 가 복잡한 물리 문제 (로켓이 어떻게 비행하는지나 전기가 어떻게 이동하는지 등을 파악하는 것) 를 해결할 수 있는지 확인하는 것입니다. 이를 평가하기 위해 대회 주최자는 일련의 시험 문제를 제공합니다.

읽고 계신 이 논문, "Physics-R1" 은 본질적으로 내부 고발 보고서이자 새로운 요리책입니다. 저자 양산 (Shan Yang) 은 현재의 요리 대회가 조작되어 있으며, 시험 문제가 오염되었고 심사위원들이 편향되어 있다고 주장합니다. 여기 간단한 용어로 정리된 내용입니다:

1. 문제: 시험 문제가 '유출'되었습니다

수학 시험을 준비하는 학생을 상상해 보세요. 만약 교사가 기말고사에도 사용하는 연습 문제집에서 정답을 우연히 외워버린다면, 완벽한 점수를 받을 수는 있지만 실제로 수학을 이해한 것은 아닙니다.

이 논문은 많은 AI 모델이 정확히 이런 행동을 하고 있음을 발견했습니다.

  • '유출': 저자들은 이러한 AI 들을 가르치는 데 사용된 공개 '학습 풀 (연습 문제집)'을 감사했습니다. 그 결과, AI 들이 평가받는 많은 시험 문제들이 실제로 그들이 공부한 연습 문제집에 숨겨져 있음을 발견했습니다.

  • '개사' 트릭: 단순히 정확한 복사본만 있는 것은 아닙니다. 때로는 AI 가 "공이 10 미터에서 떨어진다"는 문제를 보다가, 시험에서는 "반구가 10m 높이에서 떨어진다면..."이라고 묻습니다. 과거의 컴퓨터 프로그램들은 (동일한 단어를 찾는 방식으로) 치팅을 감지하지 못했습니다.

  • 새로운 감사: 저자들은 3 단계 보안 요원을 구축했습니다:

    1. 단어 카운터: 정확한 단어 매칭을 확인합니다.
    2. 의미 스캐너: 단어가 다르더라도 문장의 의미가 같은지 확인합니다.
    3. 인간 같은 심사관: 연습 문제와 시험 문제 모두를 읽어보고 "예, 이는 위장된 동일한 문제입니다"라고 결정하는 초지능 AI 입니다.

    이를 통해 해당 분야에서 놓쳤던 수천 개의 '치팅' 쌍을 발견했습니다. 그들은 AI 가 단순히 외우는 것이 아니라 실제로 학습하도록 데이터를 정제하여 정제된 학습 세트 (PHYSCORP-A) 를 만들었습니다.

2. 번역 함정: 언어가 중요합니다

운전 시험을 본다고 상상해 보세요. 모국어 지시사항일 때는 쉽게 통과하지만, 같은 시험이 외국어로 번역되면 문법이 혼란스럽거나 도로 표지판 설명이 달라져서 실패합니다.

저자들은 에스토니아어 (원어)영어 (번역본) 로 된 물리 문제로 이를 테스트했습니다.

  • 결과: 최상위 AI(Sonnet 4.5) 는 원래 에스토니아어 문제에서 30.5% 를 맞혔지만, 영어 번역본에서는 13.6% 만 맞혔습니다.
  • 교훈: 복잡한 과학 문제를 번역하면 미묘한 세부 사항이 종종 손실됩니다. 우리가 AI 를 영어로만 테스트한다면, 실제보다 물리 능력이 떨어지는 것으로 오인하거나, 물리 능력 대신 번역 능력을 테스트하게 될 수 있습니다.

3. 형식 함정: 객관식 vs 실제 사고

객관식 퀴즈 (A, B, C, D) 에서 추측하는 데는 뛰어나지만, 빈 종이에 해설을 쓰라고 하면 얼어붙는 학생을 상상해 보세요.

이 논문은 시험 형식에 따라 AI 의 수행 방식에 엄청난 격차가 있음을 발견했습니다:

  • 객관식 (쉬운 모드): AI 는 객관식 시험에서 79.7% 를 기록했습니다.
  • 주관식 (어려운 모드): 같은 AI 는 처음부터 답을 작성해야 하는 시험에서는 33.4% 만 기록했습니다.
  • 격차: 46 점 차이입니다. 이 논문은 해당 분야가 주로 추측이나 패턴 인식이 가능한 '쉬운 모드 (객관식)'에서 AI 를 테스트함으로써 AI 의 지능을 과대평가해 왔다고 주장합니다.

4. 해결책: 새로운 요리법 (Physics-R1)

이러한 문제들을 해결하기 위해 저자들은 손가락질만 한 것이 아니라 새로운 부엌을 만들었습니다.

  • 정제된 재료: 그들은 '유출'된 문제가 없는 것이 보장된 새로운 감사된 데이터셋 (PHYSCORP-A) 을 공개했습니다.
  • 새로운 시험: AI 가 한 번도 본 적이 없는 원래 문제 (주로 에스토니아와 국제 올림피아드 문제) 를 사용하는 더 어려운 새로운 시험 PHYSOLYM-A 를 만들었습니다.
  • 요리 방법 (Physics-R1): 그들은 특정 '요리법' (GSPO+DAPO라는 방법) 을 사용하여 새로운 AI 모델을 훈련시켰습니다.
    • AI 가 화려하지만 틀린 답을 쓰도록 유도할 수 있는 모든 작은 단계에 대해 복잡하고 상세한 점수를 주는 대신, 이진 보상 (Binary Reward) 을 사용했습니다.
    • 비유: 경기 심판을 생각하세요. '좋은 자세'나 '예쁜 필기'에 점수를 주는 대신, 심판은 이렇게 말합니다: "정답을 맞혔나요? 예 = 1 점, 아니오 = 0 점."
    • 이 간단한 규칙은 AI 가 화려한 포맷팅으로 '시스템을 속이려' 하는 것을 멈추게 하고, 실제로 물리 문제를 올바르게 해결하는 데 집중하도록 강제했습니다.

결과

그들은 새롭고 정제된 어려운 시험에서 새로운 AI(Physics-R1) 를 테스트했을 때 다음과 같은 결과를 얻었습니다:

  • 기본 모델에 비해 크게 향상되었습니다 (8 점에서 26 점으로 상승).
  • 다른 오픈소스 모델들을 능가했습니다.
  • 여전히 최상위 폐쇄형 '슈퍼 AI(Sonnet 4.5)'에는 미치지 못하지만, 정제된 데이터와 올바른 훈련 방법을 사용하면 오픈소스 모델도 실제 물리 추론을 학습할 수 있음을 증명했습니다.

요약

이 논문은 AI 커뮤니티를 위한 행동 촉구입니다:

  1. 치팅 중단: 모델이 시험 정답을 단순히 외우지 않도록 학습 데이터를 정제하세요.
  2. 언어 주의: 번역이 완벽하다고 가정하지 마세요. 원어로 테스트하세요.
  3. 추측 중단: 객관식뿐만 아니라 주관식 문제로 모델을 테스트하세요.
  4. 간단하게 유지하기: 때로는 복잡한 점수 체계보다 단순한 '맞음/틀림' 보상이 AI 에게 사고를 가르치는 데 더 좋습니다.

저자들은 누구나 사용할 수 있고 검증할 수 있도록 모든 '재료 (데이터)', '요리법 (코드)', 그리고 '시험 문제 (벤치마크)'를 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →