← 최신 논문
🤖 AI

PHYSICS: Benchmarking Foundation Models on University-Level Physics Problem Solving

본 논문은 1,297 개의 전문가가 주석한 대학 수준의 물리학 문제를 포괄하는 벤치마크인 PHYSICS 를 소개하며, 이는 다양한 최적화 전략에도 불구하고 o3-mini 와 같은 최첨단 기초 모델조차 59.9% 의 정확도만 달성하여 고수준 과학적 추론에 어려움을 겪고 있음을 보여줍니다.

원저자: Kaiyue Feng, Yilun Zhao, Yixin Liu, Tianyu Yang, Chen Zhao, John Sous, Arman Cohan

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kaiyue Feng, Yilun Zhao, Yixin Liu, Tianyu Yang, Chen Zhao, John Sous, Arman Cohan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 여러분이 엄청나게 똑똑하고 초고속인 로봇 군단을 구축했다고 가정해 봅시다. 이 로봇들은 도서관에 있는 거의 모든 책을 읽었으며, 인간용 계산기보다 복잡한 수학 퍼즐을 더 빠르게 풀 수 있습니다. 여러분은 궁금해할 것입니다: 이 로봇들은 실제로 진짜 물리학자처럼 생각할 수 있을까요?

바로 이것이 PHYSICS 벤치마크를 개발한 연구자들이 알아내고자 했던 점입니다. 그들은 로봇들에게 단순한 수수께끼를 풀게 한 것이 아니라, 물리학 분야에서 "박사 학위 과정의 최종 시험"을 치르게 했습니다.

다음은 그들의 실험 이야기를 간결하게 정리한 것입니다:

1. 시험: "최종 물리학 테스트"

연구자들은 PHYSICS라는 새로운 테스트를 만들었습니다. 이를 1,297 개의 어려운 문제가 담긴 거대한 디지털 문제은행으로 생각하세요.

  • 문제는 어디서 왔을까요? 연구자들이 만든 것이 아닙니다. 실제 물리학 박사 과정 학생들이 전문 과학자가 되기 위해 통과해야 하는 가혹한 자격시험에서 가져온 것입니다.
  • 시험에는 무엇이 있나요? 물리학의 주요 여섯 가지 영역을 다룹니다: 사물의 운동 (역학), 원자의 행동 (양자), 열과 에너지 (열역학), 전기와 자기, 빛 (광학), 그리고 원자 물리학입니다.
  • 반전: 단순히 "A, B, C, D" 중 하나를 고르는 학교 시험과 달리, 이 문제들은 서술형입니다. 로봇은 인간 학생처럼 전체 풀이 과정을 보여 주며 해답을 작성해야 합니다.

2. 채점 기계: "로봇 선생님"

사람이 모든 페이지를 읽지 않고도 로봇의 수학 숙제를 어떻게 채점할 수 있을까요? 팀은 엄격하게 자동화된 채점 시스템을 구축했습니다.

  • SymPy라는 디지털 도구 (수학 확인 로봇이라고 생각하세요) 를 사용하여 로봇이 약간 다른 방식으로 답을 작성했더라도 수학적으로 정확한지 검증합니다.
  • 만약 수학이 너무 이상해서 로봇이 확인하기 어렵다면, 논리를 읽고 타당한지 판단하는 "보조 교사"(더 고급 AI) 를 호출합니다.

3. 결과: "로봇들이 벽에 부딪히다"

연구자들은 o3-mini, GPT-4o, DeepSeek-R1 같은 "챔피언"을 포함한 오늘날 이용 가능한 33 개의 가장 똑똑한 AI 모델을 테스트했습니다.

스코어보드:

  • 최고의 로봇: 가장 똑똑한 모델인 o3-mini조차도 문제의 약 **60%**만 정확히 풀었습니다.
  • 평균 로봇: 대부분의 다른 최상위 모델은 30% 에서 40% 사이의 점수를 받았습니다.
  • 인간 기준: 연구자들은 충분한 시간이 주어지면 인간 전문가가 일반적으로 70% 에서 80% 사이의 점수를 받을 것이라고 지적했습니다.

핵심 교훈: 가장 첨단 AI 조차도 인간 물리학 전문가의 수준에 도달하는 데 여전히 고군분투하고 있습니다. 그들은 교과서를 외운 학생처럼 보이지만, 복잡한 실제 시나리오에 규칙을 적용하라고 요구받으면 막혀 버립니다.

4. 왜 실패했을까요? ("오류의 전당")

연구자들은 로봇들이 왜 정답을 틀렸는지 자세히 살펴보았습니다. 그들은 다섯 가지 주요 "나쁜 습관"을 발견했습니다:

  1. 규칙을 만들어 내기: 때때로 로봇들은 질문에 없는 사실을 만들어 냅니다. 마치 학생이 선생님의 마음을 추측하여 존재하지 않는 추가 규칙을 덧붙이는 것과 같습니다.
  2. 그림을 무시하기: 많은 물리학 문제에는 도표가 함께 제공됩니다. 로봇들은 종종 그림을 잘못 해석하여 전선이 한쪽으로 연결된 것으로 생각했지만 실제로는 다른 쪽으로 연결되어 있었습니다.
  3. "과도한 사고" 함정: 일부 로봇은 너무 열심히 생각하고 너무 많이 작성하여 공간이 부족해지거나 자신의 긴 설명에 혼란을 겪었습니다. 그들은 자신의 추론 속에 빠져버렸습니다.
  4. 수학 실수: 논리가 완벽할지라도 복잡한 방정식에서 간단한 계산 실수를 저지르곤 했습니다. 마치 인간이 긴 수학 문제에서 오타를 내는 것과 같습니다.
  5. 요점을 놓치기: 때로는 질문이 실제로 무엇을 묻는지 오해하여 완전히 다른 질문에 답하기도 했습니다.

5. 도움을 주려 했나요? ("요약 노트" 실험)

연구자들은 로봇들이 더 잘할 수 있도록 몇 가지 방법을 시도했습니다:

  • 자기 성찰: 로봇들에게 "제출하기 전에 자신의 작업을 확인해 보세요"라고 말했습니다. 이는 조금 도움이 되어 답변이 약간 더 일관되게 만들어졌습니다.
  • "구글" 트릭 (RAG): 로봇들이 작업하는 동안 온라인에서 정보를 찾아보게 했습니다. 이 또한 점수 향상에 도움이 되었으며, 로봇들이 때로는 특정 공식이나 사실에 대한 빠른 상기만 필요로 했음을 증명했습니다.

그러나 이러한 도움들에도 불구하고 로봇들은 여전히 인간 전문가와의 격차를 완전히 좁히지 못했습니다.

결론

PHYSICS 벤치마크는 AI 가 수학과 독해에는 놀라울 정도로 뛰어나지만, 깊고 복잡한 과학적 문제를 해결하는 것은 여전히 거대한 도전임을 보여줍니다. 로봇들은 때로는 왜 수학을 하고 있는지 잊어버리는 매우 빠른 계산기들과 같습니다. 이들을 진짜 물리학자 수준으로 끌어올리기 위해서는 더 깊이 추론하고, 도표를 더 잘 읽으며, 사실을 만들어 내는 것을 멈추도록 가르쳐야 합니다.

이는 물리학만의 문제가 아닙니다. AI 가 과학자들을 진정으로 돕기 위해서는 기계처럼 "계산"하는 것이 아니라 인간 전문가처럼 "생각"하는 능력을 훨씬 더 향상시켜야 한다는 경각심을 주는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →